三份AI gent报告,对一篇文章c15162 进行分析,采用相同的提示词,文件1采用Agnes code——agnes 3.0 flash,文件2采用open code+Nemotro 3 Ultra,文件3采用PI+Deepseek v4 Flash,其中,前两者免费,第三个速度最快,以下是对比结果
评价基准:c15162.pdf 原文(44 页)
比较对象:1.md、2.md、3.md
比较维度:准确度(事实是否正确)、精度(细节颗粒度与数值精确性)、结构完整性、错误/遗漏
一、总体结论(先给判断)
| 报告 | 定位 | 准确度 | 精度 | 综合 |
|---|---|---|---|---|
| 1.md | 结构最完整、覆盖面最广 | 中—高 | 中 | 信息量最大,但有若干数值/事实小错 |
| 2.md | 结构清晰、表格化、偏"摘要+图谱" | 中 | 中 | 可读性最好,但存在明显数值错误与夸大 |
| 3.md | 复核版,逐页核对、带勘误 | 最高 | 最高 | 唯一做了"事实核查 + 勘误"的报告,方法论审计最强 |
一句话:3.md 在准确度和精度上明显领先,1.md 在广度上接近但精度不足,2.md 最易读但错误最多。
二、逐项事实核对(准确度)
1. 核心数值
| 项目 | 原文 | 1.md | 2.md | 3.md |
|---|---|---|---|---|
| 基准 IV 系数 | 0.67 pp(列2,含人口控制);列1 = 0.94 | ✅ 0.67 / 0.94 | ✅ 0.67 | ✅ 0.67(并注明列1=0.94) |
| 相对增幅 | 0.67/0.58 ≈ 1.1% | ✅ | ✅ | ✅ |
| 25–44 岁 | −0.45*(−1.70%)** | ✅ −0.45 | ✅ −0.45(−1.7%) | ✅ |
| 16–19 岁 | +0.15*(+7.02%)** | ✅ | ✅(+7%) | ✅ |
| 45–54 岁 | +0.43*(+3.01%)** | ✅ +0.43 | ✅ +3% | ✅ |
| 55–64 岁 | +0.38*(+4.00%)** | ✅ | ✅ +4% | ✅ |
| 教育 <HS | −0.05(−1.08%)** | ✅ −0.05 | ✅ −0.05 | ✅ |
| 高中 | −0.16(−1.32%)** | ✅ −0.16 | ✅ −0.16 | ✅ |
| 部分大学 | +0.22(+1.41%)** | ✅ | ✅ | ✅ |
| 本科+ | +0.35(+2.05%)** | ✅ +0.35 | ✅ +0.35 | ✅ |
| 收入总效应 | +1.96%*(≈+$708) | ✅ +1.96%($708) | ✅ +1.96% | ✅ +1.96%,并给出年均≈$101 |
| 分期 P1 | +0.36~0.45 | ⚠️ 只写 +0.36 | ✅ +0.36 / +0.30 | ✅ 完整 |
| 分期 P2 | +0.30* | ⚠️ 只写 +0.30 | ✅ | ✅ |
| P2/P1 | +0.23*(列4) | ⚠️ "不显著"(错,见下) | 未提 | ✅ 准确:仅第二期回归中 +0.23* |
| 技术家族 | 仅 3D Printing −0.22*、E-Commerce +0.36* 10%显著 | ⚠️ 说"仅 E-Commerce 和 Payment Systems 显著"(错) | ❌ 说"无单一家族显著"(错) | ✅ 准确,并指出前报告错误 |
| HHI | 0.077 | ✅ | ✅ | ✅ |
| 非美专利占比 | 64% 非美 / 36% 美 | ✅ | ✅ | ✅ |
| IV 相关性 | ≈ 0.99 | ✅ | ✅ | ✅ |
| 样本 | 741 CZ | ✅ | ✅ | ✅ |
| 职业数 | 1,110(8-digit) | ✅ | ✅ | ✅ |
| 行业数 | 324(4-digit) | ✅ | ✅ | ✅ |
| 技术数 | 40 技术 / 9 家族 | ✅ | ✅ | ✅ |
准确度小结:
3.md 全部核对通过,且主动纠正了前两份报告的错误。
1.md 有 2 处实质错误:P2/P1 显著性判断错(说"不显著",实际列4为 +0.23*)、技术家族显著项判断错(说 E-Commerce + Payment Systems,实际是 3D Printing + E-Commerce)。
2.md 有 1 处实质错误:"无单一家族显著",且未提 P2/P1 系数。
2. 方法论细节
| 项目 | 原文 | 1.md | 2.md | 3.md |
|---|---|---|---|---|
| 嵌入模型 | MPNet v2 (Song 2020) | ✅ | ✅ | ✅ |
| 4-digit NAICS 理由 | 生产过程共性 vs 5-digit 产品差异 | ✅ | ✅ | ✅ 更详细 |
| 8-digit SOC 理由 | 教育/技能更同质 | ✅ | ✅ | ✅ |
| QCEW 放弃原因 | 非随机缺失与人口/暴露相关 | ✅ | ✅ | ✅ |
| IV 依据 | Borusyak et al. 2021(外生性在 shock) | ✅ | ✅ | ✅ |
| 标准误 | AKM0 (Adão 2019) | ✅ | ✅ | ✅ 并指出论文未指定软件包 |
| 分期动机 | 时滞/vintage 不确定 | ✅ | ✅ | ✅ |
| 技术家族互补性 | 效应来自组合 | ✅ | ✅ | ✅ 并指出"互补性未被检验" |
三份在方法论描述上都基本准确,3.md 多出"论文未做/未报告"的审计层。
三、精度比较(细节颗粒度)
1. 数值精度
3.md 最精确:不仅给系数,还给百分比换算、美元换算、显著性星号、列号,并标注"逐页核对"。
1.md 精度次之:数值基本对,但换算和显著性偶有缺失/错误。
2.md 精度最弱:大量用"约""+7%""+4%"等概数,且未给列号。
2. 结构精度
| 维度 | 1.md | 2.md | 3.md |
|---|---|---|---|
| 数据构建流程 | 8 步 ASCII 流程图,最细 | 5 步表格 | 7 环节 + 逐环节拆解,最细 |
| 文献引用 | 定性分层 + 简化网络图 | 三张网络图 + 频次估计 | 实测频次表 + 五层功能图谱 + 结构诊断 |
| 表格速览 | 有(13 张表/图) | 有(Table 1–10) | 有(含 Table 14 未完成提示) |
| 勘误 | 无 | 无 | 有(对前报告逐条勘误) |
| 方法论审计 | 有"潜在局限" | 有"关注点" | 有独立审计表 A1–A9,含严重度 |
| 一句话总评 | 无 | 无 | 有 |
精度结论:3.md 在"引用频次实测""勘误""审计"三块是唯一做到精确量化的。
四、准确度/精度之外的结构完整性
| 维度 | 1.md | 2.md | 3.md |
|---|---|---|---|
| 基本信息 | ✅ | ✅ | ✅(含 JEL、页数、源文件路径) |
| 核心发现 | ✅ 3 大 + 收入 + 时间 + 技术族 | ✅ 3 大 | ✅ 3 大 + 3 个"非显然"发现 |
| 数据构建 | ✅ 最详(模块 A/B) | ✅ 表格化 | ✅ 7 环节 |
| 识别策略 | ✅ | ✅ | ✅ 含两条识别假设明示 |
| 文献引用 | ✅ 定性 | ✅ 图谱 | ✅ 实测 + 图谱 + 诊断 + 改进清单 |
| 方法论审计 | ⚠️ 简略 | ⚠️ 简略 | ✅ 独立章节 |
| 勘误 | ❌ | ❌ | ✅ |
| 复现建议 | ✅ | ✅ | ❌(但审计更实用) |
五、各报告的独立错误/遗漏清单
1.md 的问题
P2/P1 显著性判断错:"相对变化(P2/P1)不显著"——原文列4为 +0.23*(10%显著)。
技术家族显著项错:说"E-Commerce 和 Payment Systems 显著",实际是 3D Printing(−0.22*)与 E-Commerce(+0.36*)。
引用频次用"10+""5+""4+""3+"等模糊表述,未实测。
未提 Table 7/14 表注"Notes: To add"未完成。
未提无第一阶段 F 统计量这一关键缺陷。
2.md 的问题
"无单一家族显著"错——与原文矛盾。
"17 篇参考文献"错——原文恰好 20 条。
引用频次"10+""5+""4+"等为估计,非实测;Prytkova 实为 12 次,Adão 实为 7 次。
称"AKM0 via
akm0包"——论文未指定软件包。未提 P2/P1 系数、未提表注未完成、未提无第一阶段 F。
把 Frey & Osborne、Felten 等归入"负向阵营"过于简化(Frey-Osborne 是预测、非估计)。
3.md 的问题
自称"无孤儿文献"时写"24 条中每条至少被引 1 次"——但全文是 20 条,此处"24"应为笔误。
未给复现/扩展建议(2.md、1.md 有)。
部分判断(如"互补性假设未被检验")属审稿意见,非纯描述,但标注清晰、可接受。
六、结论性排序
准确度:3.md > 1.md > 2.md
3.md 零实质错误,且纠正他人错误。
1.md 两处实质错误。
2.md 三处实质错误(含最关键的"家族显著"和"文献数")。
精度:3.md > 1.md > 2.md
3.md 做到逐页、逐系数、逐列核对,并给出百分比/美元换算与实测引用频次。
1.md 数值较全但换算/显著性有缺。
2.md 大量概数、无列号、无实测。
可读性/易用性:2.md ≈ 1.md > 3.md
2.md 表格化、图谱化,最适合快速浏览。
3.md 信息密度最高,但篇幅长、审计色彩重。
综合推荐:
若只要结论和定位:读 2.md。
若要全面覆盖 + 数据流程:读 1.md。
若要引用、复核、写审稿意见或做二次研究:必须用 3.md,且应以其勘误表为准修正 1.md、2.md。

研报速递
发表评论
发表评论: