剑桥大学:《2025-2026年AI智能体指数报告》

 
 
 
 
 
 
 
图片

 

 

2025年,AI智能体的搜索量爆增,学术论文数量超过2020至2024年五年总和的两倍,企业部署计划排满日程表。这一切看起来像是一场技术革命已然成熟的标志。然而,一份由剑桥大学、麻省理工学院、哈佛法学院和斯坦福大学的研究团队联合发布的报告,在繁荣表象之下揭示了另一层现实:当AI智能体的能力以前所未有的速度向前奔跑,关于它们如何运作、如何被评估、如何被约束的公开信息,却在以同等的速度缺席。

这份报告的正式名称是《2025-2026年AI智能体指数》(The 2025-2026 AI Agent Index),由以剑桥大学Leon Staufer为第一作者的跨机构研究团队主导完成,相关数据库同步在麻省理工学院网站发布。报告系统性地记录了30个当前最具影响力的智能体AI系统,涵盖技术能力、自主性与控制、生态系统交互、安全评估等六大类共45个信息字段,是迄今为止规模最大、维度最全面的AI智能体横截面分析。研究团队以2025年12月31日为数据截止节点,基于公开文档、产品演示和与开发者的邮件往来完成标注,采集信息总量达1350个字段。这是一项刻意克制的学术工程——不依赖传闻,不做推测,只记录可查证的事实,并用"未发现"与"确认不存在"的严格区分来处理信息空白。

三类智能体,一张分化的权力版图

报告将30个入选系统划分为三类:12个对话式智能体(Chat Agent,含工具调用能力)、13个企业工作流智能体(Enterprise Workflow Agent)和5个浏览器智能体(Browser Agent)。这三种形态代表了当前智能体AI商业落地的三种主要路径,也对应着三种截然不同的自主性结构与风险分布。

入选标准严苛而系统:候选系统必须同时满足自主性(能独立处理多步任务而无需持续人工干预)、目标复杂性(能将高层目标拆解为子目标链)、环境交互(具备对外部世界的写入权限)和通用性(能适应多类未明确指定的任务)四项"代理性"基准,并在公众关注度、市场规模或开发者重要性中满足至少一项影响力标准,同时须为已公开部署的商用产品。最终,研究团队从95个候选系统中筛选出30个入选,涵盖Anthropic Claude、OpenAI ChatGPT Agent、Google Gemini、Manus AI、Salesforce Agentforce、Microsoft Copilot Studio、Perplexity Comet等当前最具代表性的系统。

从地理分布看,30个系统中有21个注册于美国(其中13个在特拉华州),5个注册于中国,其余4个分布于德国(SAP、n8n)、挪威(Opera)和开曼群岛(Manus)。这一集中格局不仅是商业地图的写照,也直接塑造了整个生态系统的治理模式。报告指出,美国开发者中95%发布了AI安全框架文件、76%记录了合规标准;而中国开发者中,仅Z.ai一家发布了安全信任框架,且只有1家满足合规标准记录要求。报告特别说明,中国企业的合规实践可能存在但未在公开文档中体现,这一解释性注释体现了研究者在跨国比较中保持的方法论克制。

在技术架构上,报告揭示了一个引发警觉的集中性:几乎所有入选系统都将GPT、Claude或Gemini系列作为底层模型,只有美国和中国的前沿实验室自主运行专有模型。这意味着绝大多数智能体开发者构建的是依附于少数几个基础模型的上层应用,而非独立的技术体系。这种共享依赖关系制造了潜在的单点失效风险——一旦上游模型出现定价变动、服务中断或安全退化,整个应用生态都可能受到牵连。与此同时,20个系统支持模型上下文协议(MCP),这是当前智能体互操作性的主导标准;A2A(智能体间通信协议)出现在6个系统中,且全部集中于企业平台,显示出这两类协议在不同市场场景中的分工已初步形成。

自主性的悖论:设计阶段的低自主与部署后的高自主

报告在自主性分析维度的发现,是整个研究中最具现实意涵的部分之一。研究采用Feng等人提出的L1至L5自主等级框架,以人类在交互中扮演的角色来定义自主程度:L1为人类完全主导,L5为智能体完全自主、人类仅作观察者。

数据呈现出一个颇具张力的结构性规律。对话式智能体通常在L1至L3范围内运行,以轮次制交互为主,用户保持较高的过程参与度;浏览器智能体则普遍处于L4至L5高度自主区间,一旦启动便几乎不提供中途干预的机制——Perplexity Comet和Browser Use的智能体在被触发后即可完全自主执行,用户在任务结束前无法介入或引导。企业平台展现出最具特色的"设计/部署自主性分裂":在配置阶段,用户通过可视化画布手动设定触发条件、操作边界和安全护栏(L1至L2);一旦部署上线,这些智能体往往在L3至L5高度自主模式下持续运行,由新邮件、数据库变更等事件自动触发,全程无需人工参与——Glean、Google Gemini Enterprise、IBM watsonx、Microsoft Copilot Studio、n8n和OpenAI AgentKit均属此列。

紧急停止机制的覆盖情况同样值得重视。报告发现,20个系统记录了暂停/停止机制,但Alibaba MobileAgent、HubSpot Breeze、IBM watsonx和n8n四个系统在具备自主执行能力的同时,却没有任何已记录的停止选项。对于企业平台而言,有时仅有停止所有智能体或撤销整体部署的选项,缺乏针对单次任务的精细化干预能力。

与此同时,报告揭示了一个令人忧虑的识别现状:21个系统在默认情况下,没有任何文档规定在与非用户人类交互时须主动披露自身AI身份;仅3个系统支持对生成内容进行水印标注;7个系统发布了稳定的用户代理字符串和IP地址范围,供第三方核验身份;而6个系统则明确使用类Chrome的用户代理字符串和本地IP,刻意模拟人类网络请求。Perplexity的Comet被Cloudflare记录到使用未声明的爬虫程序规避网站屏蔽,并因此受到亚马逊的法律威胁。ChatGPT Agent是30个系统中唯一一个实现了HTTP请求加密签名(RFC 9421标准)的系统——这一设计使其行为可被第三方核验,报告认为这是应对智能体身份追责问题的关键技术实践。

安全透明度:一个系统性缺口

报告最具冲击力的发现,集中于安全评估的透明度上。在覆盖30个系统的1350个信息字段中,有198个字段无法找到任何公开信息;而在全部240个安全相关字段中,多达133个(约55%)没有任何可查信息。浏览器智能体(64%的安全字段缺失)和企业智能体(63%缺失)的信息空白率最高,对话式智能体相对好一些,但也有43%的安全字段无信息可查。

从开发者披露实践看,格局相当分化。OpenAI、Anthropic和Google三家前沿实验室在安全评估上投入最多,发布系统卡、覆盖灾难性风险和自主性滥用场景,并有第三方测试记录——但这类实践的覆盖范围依然有限,在30个系统中仅有ChatGPT Agent、OpenAI Codex、Claude Code和Gemini 2.5 Computer Use提供了智能体专属系统卡。企业平台则倾向于将安全问题转化为合规问题,以SOC 2、ISO 27001等认证替代对智能体特定风险的实质性披露。30个系统中有25个完全不披露内部安全评估结果,23个没有任何第三方测试记录,仅3个系统(Anthropic Claude、OpenAI ChatGPT、OpenAI Codex)有明确的第三方测试记录。

报告将这种现象定性为一种弱化形式的"安全清洗"(safety washing)——安全和伦理框架停留于高层原则,用于评估实际风险所需的实证证据却被选择性地压制。更重要的是,报告指出了一个系统性的评估逻辑误区:当前的安全评估往往集中于基础模型层面,而智能体系统的风险本质上来源于规划能力、工具调用、记忆架构和执行策略的综合交互——这些特性只有在具体部署环境中才能被准确测量。仅凭底层模型的安全文档无法为智能体行为提供有效担保,买方和监管者据此形成的安全感,可能是一种系统性的误判。

由此产生的问责扩散问题同样棘手。如图7所示,单个开发者通常只控制智能体生态系统中的部分环节——有的控制基础模型和脚手架,有的控制编排层,有的则只负责具体工作流配置。这种控制权的碎片化使得"谁应为特定智能体的行为负责"成为一个没有清晰答案的问题。正是在此意义上,报告发出的警示超越了技术评估的范畴:在能力已然领跑、监管仍在追赶的时间窗口内,透明度本身不仅是学术议题,更是一个具有切实社会后果的治理命题。

研究团队认为,《2025年AI智能体指数》建立的是一条基准线,而非终点。他们明确指出,基础模型集中化、问责权碎片化、能力与安全披露的结构性不对称——这三大模式不会自行消解。随着智能体能力持续跃升,这些治理缺口的代价只会以加速度扩大。研究者的呼吁指向明确:建立结构化的强制报告要求,或推动大规模协调的行业透明度自律机制——在这两者出现之前,AI智能体的扩张将持续先于我们理解它的速度。

 

 

 

 

 

 

 

来源:21世纪关键技术

 
 
 
 
 
 

免责声明:本账号所发布的一切内容,包括但不限于文字、图片及数据,均来源于原创、投稿、转载或公开资料,仅供读者学习交流之目的。所有内容不代表本平台观点,其版权归属原作者或原始出版方。未经许可,不得用于商业用途。如发现内容标注有误或涉嫌侵权,请及时联系我们,我们将在核实后立即处理。特此声明。

 

 

       

 

 

 

首页    行业动态    研究报告    剑桥大学:《2025-2026年AI智能体指数报告》
创建时间:2026-04-05 09:05
浏览量:0