一份把视线从内容挪开的报告
中国信通院政策与经济研究所联合中国政法大学人工智能法研究院,2026年9月发布73页《智能体治理研究报告》。这是国内第一份把智能体作为独立治理对象的系统性报告,脱胎于早年的AI100评估脉络。它把治理的视线从「模型说了什么」移开,落在「智能体做了什么」上。
报告的核心判断很直白:人工智能治理正从以内容合规、事前审查为重心的模型治理,转向以行为约束、全周期管控为重的智能体治理。监管关心的不再只是吐出的字对不对,而是调用工具、下单付款、改写文件这一连串动作有没有越界。过去管的是嘴,现在管的是手,落点彻底变了。

01 能办事,但只办短差事
能力不是齐步走。业内把这种形态叫锯齿状能力:某一项突然封顶,换一项又露怯。GAIA基准准确率2025年1月仅30%,9月冲到74.5%;2026年6月CustomGPT.ai以93.36%首超约92%的人类均值。METR数据显示,2026年初50%可靠完成的任务时长已接近12小时,约每7个月翻一番。
可一旦任务拉到数小时,成功率断崖下跌:超过4小时人类工时的任务成功率不足10%,OSWorld 2.0里超过163分钟的任务完成率几乎归零。智能体擅长短链条,长程多步仍是软肋,代价是单步误差会沿链条放大。这种长短板并存,决定了治理不能一刀切。

02 风险从「说错」变成「做错」
当智能体开始直接操作软件,幻觉就由输出错误升级为行动错误,甚至混入slopsquatting这类供应链入侵。权限给得越宽,越错越隐蔽。NHI Mgmt Group 2026年调查显示,70%组织给智能体的权限超过同等人类员工,80%报告过超预期行为。Snyk同年2月扫描ClawHub近四千个Skill,超36%存在后门指令等缺陷,确认恶意76个。开源生态里人人能发包,审核却跟不上,这正是先管身份再管能力的原因。


03 三层缰绳套住行为
报告开出药方:基础层做到身份可信、权限可控、数据可管;运行层做审查评估、风险分级、透明披露与风险干预;生态层配置责任、可信互联、竞争有序。国标《人工智能 智能体互联》身份码分7类32位,已发放超2000个,先把「谁在干活」钉死。数据可管要求训练与运行数据留痕,便于事后溯源定责;责任配置一节强调,越自主的智能体,越要把追责链条写在前头,而不是出事后再追。

写在最后
模型时代的治理盯着内容,智能体时代的治理得盯着行为。沙利文测算渗透率达25%时,工具类应用商业价值预计降近四成,外溢已经看得见。这份报告的价值,是早一步把「会自己干活」这件事放回制度里称量,而不是等出了事再补墙。
点击获取PDF版本👇
更多访问👇


研报速递
发表评论
发表评论: