行业资讯

加入亿拓客·流量大师 撬动财富之门!!!

三份 AI agent 分析报告比较

wang 2026-09-18 行业资讯
三份 AI agent 分析报告比较

   三份AI gent报告,对一篇文章c15162 进行分析,采用相同的提示词,文件1采用Agnes code——agnes 3.0 flash,文件2采用open code+Nemotro 3 Ultra,文件3采用PI+Deepseek v4 Flash,其中,前两者免费,第三个速度最快,以下是对比结果

评价基准:c15162.pdf 原文(44 页)
比较对象:1.md、2.md、3.md
比较维度:准确度(事实是否正确)、精度(细节颗粒度与数值精确性)、结构完整性、错误/遗漏


一、总体结论(先给判断)

报告定位准确度精度综合
1.md结构最完整、覆盖面最广中—高信息量最大,但有若干数值/事实小错
2.md结构清晰、表格化、偏"摘要+图谱"可读性最好,但存在明显数值错误与夸大
3.md复核版,逐页核对、带勘误最高最高唯一做了"事实核查 + 勘误"的报告,方法论审计最强

一句话:3.md 在准确度和精度上明显领先,1.md 在广度上接近但精度不足,2.md 最易读但错误最多。


二、逐项事实核对(准确度)

1. 核心数值

项目原文1.md2.md3.md
基准 IV 系数0.67 pp(列2,含人口控制);列1 = 0.94✅ 0.67 / 0.94✅ 0.67✅ 0.67(并注明列1=0.94)
相对增幅0.67/0.58 ≈ 1.1%
25–44 岁−0.45*(−1.70%)**✅ −0.45✅ −0.45(−1.7%)
16–19 岁+0.15*(+7.02%)**✅(+7%)
45–54 岁+0.43*(+3.01%)**✅ +0.43✅ +3%
55–64 岁+0.38*(+4.00%)**✅ +4%
教育 <HS−0.05(−1.08%)**✅ −0.05✅ −0.05
高中−0.16(−1.32%)**✅ −0.16✅ −0.16
部分大学+0.22(+1.41%)**
本科++0.35(+2.05%)**✅ +0.35✅ +0.35
收入总效应+1.96%*(≈+$708)✅ +1.96%($708)✅ +1.96%✅ +1.96%,并给出年均≈$101
分期 P1+0.36~0.45⚠️ 只写 +0.36✅ +0.36 / +0.30✅ 完整
分期 P2+0.30*⚠️ 只写 +0.30
P2/P1+0.23*(列4)⚠️ "不显著"(错,见下)未提✅ 准确:仅第二期回归中 +0.23*
技术家族仅 3D Printing −0.22*、E-Commerce +0.36* 10%显著⚠️ 说"仅 E-Commerce 和 Payment Systems 显著"(错)❌ 说"无单一家族显著"(错)✅ 准确,并指出前报告错误
HHI0.077
非美专利占比64% 非美 / 36% 美
IV 相关性≈ 0.99
样本741 CZ
职业数1,110(8-digit)
行业数324(4-digit)
技术数40 技术 / 9 家族

准确度小结:

  • 3.md 全部核对通过,且主动纠正了前两份报告的错误。

  • 1.md 有 2 处实质错误:P2/P1 显著性判断错(说"不显著",实际列4为 +0.23*)、技术家族显著项判断错(说 E-Commerce + Payment Systems,实际是 3D Printing + E-Commerce)。

  • 2.md 有 1 处实质错误:"无单一家族显著",且未提 P2/P1 系数。

2. 方法论细节

项目原文1.md2.md3.md
嵌入模型MPNet v2 (Song 2020)
4-digit NAICS 理由生产过程共性 vs 5-digit 产品差异✅ 更详细
8-digit SOC 理由教育/技能更同质
QCEW 放弃原因非随机缺失与人口/暴露相关
IV 依据Borusyak et al. 2021(外生性在 shock)
标准误AKM0 (Adão 2019)✅ 并指出论文未指定软件包
分期动机时滞/vintage 不确定
技术家族互补性效应来自组合✅ 并指出"互补性未被检验"

三份在方法论描述上都基本准确,3.md 多出"论文未做/未报告"的审计层


三、精度比较(细节颗粒度)

1. 数值精度

  • 3.md 最精确:不仅给系数,还给百分比换算、美元换算、显著性星号、列号,并标注"逐页核对"。

  • 1.md 精度次之:数值基本对,但换算和显著性偶有缺失/错误。

  • 2.md 精度最弱:大量用"约""+7%""+4%"等概数,且未给列号。

2. 结构精度

维度1.md2.md3.md
数据构建流程8 步 ASCII 流程图,最细5 步表格7 环节 + 逐环节拆解,最细
文献引用定性分层 + 简化网络图三张网络图 + 频次估计实测频次表 + 五层功能图谱 + 结构诊断
表格速览有(13 张表/图)有(Table 1–10)有(含 Table 14 未完成提示)
勘误有(对前报告逐条勘误)
方法论审计有"潜在局限"有"关注点"有独立审计表 A1–A9,含严重度
一句话总评

精度结论:3.md 在"引用频次实测""勘误""审计"三块是唯一做到精确量化的。


四、准确度/精度之外的结构完整性

维度1.md2.md3.md
基本信息✅(含 JEL、页数、源文件路径)
核心发现✅ 3 大 + 收入 + 时间 + 技术族✅ 3 大✅ 3 大 + 3 个"非显然"发现
数据构建✅ 最详(模块 A/B)✅ 表格化✅ 7 环节
识别策略✅ 含两条识别假设明示
文献引用✅ 定性✅ 图谱✅ 实测 + 图谱 + 诊断 + 改进清单
方法论审计⚠️ 简略⚠️ 简略✅ 独立章节
勘误
复现建议❌(但审计更实用)

五、各报告的独立错误/遗漏清单

1.md 的问题

  1. P2/P1 显著性判断错:"相对变化(P2/P1)不显著"——原文列4为 +0.23*(10%显著)。

  2. 技术家族显著项错:说"E-Commerce 和 Payment Systems 显著",实际是 3D Printing(−0.22*)与 E-Commerce(+0.36*)

  3. 引用频次用"10+""5+""4+""3+"等模糊表述,未实测。

  4. 未提 Table 7/14 表注"Notes: To add"未完成。

  5. 未提无第一阶段 F 统计量这一关键缺陷。

2.md 的问题

  1. "无单一家族显著"错——与原文矛盾。

  2. "17 篇参考文献"错——原文恰好 20 条

  3. 引用频次"10+""5+""4+"等为估计,非实测;Prytkova 实为 12 次,Adão 实为 7 次

  4. 称"AKM0 via akm0 包"——论文未指定软件包。

  5. 未提 P2/P1 系数、未提表注未完成、未提无第一阶段 F。

  6. 把 Frey & Osborne、Felten 等归入"负向阵营"过于简化(Frey-Osborne 是预测、非估计)。

3.md 的问题

  1. 自称"无孤儿文献"时写"24 条中每条至少被引 1 次"——但全文是 20 条,此处"24"应为笔误。

  2. 未给复现/扩展建议(2.md、1.md 有)。

  3. 部分判断(如"互补性假设未被检验")属审稿意见,非纯描述,但标注清晰、可接受。


六、结论性排序

准确度:3.md > 1.md > 2.md

  • 3.md 零实质错误,且纠正他人错误。

  • 1.md 两处实质错误。

  • 2.md 三处实质错误(含最关键的"家族显著"和"文献数")。

精度:3.md > 1.md > 2.md

  • 3.md 做到逐页、逐系数、逐列核对,并给出百分比/美元换算与实测引用频次。

  • 1.md 数值较全但换算/显著性有缺。

  • 2.md 大量概数、无列号、无实测。

可读性/易用性:2.md ≈ 1.md > 3.md

  • 2.md 表格化、图谱化,最适合快速浏览。

  • 3.md 信息密度最高,但篇幅长、审计色彩重。

综合推荐:

  • 若只要结论和定位:读 2.md。

  • 若要全面覆盖 + 数据流程:读 1.md。

  • 若要引用、复核、写审稿意见或做二次研究:必须用 3.md,且应以其勘误表为准修正 1.md、2.md。

猜你喜欢

发表评论

发表评论: