AI Agent 能力被低估?四大信号揭示真相
引言
近期,AI 行业涌现出多个看似独立却相互关联的热点:Bridgewater 的金融测试显示定制模型超越 GPT 和 Claude;英国 AI 安全研究所发现标准基准严重低估 Agent 能力;安全漏洞报告因 AI 辅助而激增;浏览器战争转向 Agent 原生体验。这些信号共同指向一个核心事实:AI Agent 的真实能力正在被系统性地低估,而中国开发者需要重新审视评估标准与落地策略。
金融测试:公开数据之外的 Agent 潜力
Bridgewater 与 Thinking Machines Lab(前 OpenAI CTO Mira Murati 创办)合作,基于 Qwen3-235B 模型微调了一个金融专用 Agent。在内部测试中,该模型达到 84.7% 的准确率,超越 Gemini、Claude 和 GPT,而成本仅为后者的约十四分之一。关键点在于:测试题目从未公开过。这意味着标准基准(如 MMLU、HumanEval)中大量题目可能已被模型“记住”,而非真正检验推理能力。
对中国读者的启示:不要迷信公开基准排名。在金融、医疗、法律等垂直领域,用私有数据集微调开源模型(如 Qwen、DeepSeek)可能获得远超通用闭源模型的效果,且成本可控。
基准测试:计算预算的隐藏天花板
英国 AI 安全研究所(UK AISI)的一项研究揭示了更结构性的问题:标准基准通过限制计算预算,系统性地低估了 Agent 能力。在软件工程任务中,当 token 预算增加 10 倍时,成功率跃升约 25%。这意味着许多 Agent 并非“做不到”,而是“没被允许花足够时间思考”。
这与中国 AI 社区的“长思考”趋势不谋而合。DeepSeek-R1 等模型已证明,通过链式推理(Chain-of-Thought)延长思考时间可以显著提升复杂任务表现。建议中国开发者在评估 Agent 时,不要只关注单次推理的准确率,而应测试不同计算预算下的能力曲线。
安全漏洞:Agent 的“双刃剑”效应
Epoch AI 报告显示,2026 年 6 月,21 个组织报告了约 1500 个高严重性和关键性 CVE(通用漏洞披露),是此前月度纪录的 3.5 倍以上。这一激增与 AI 驱动的漏洞狩猎程序上线时间高度吻合。
这并非坏事。AI Agent 正在成为网络安全领域的“超级助手”,能够以人类无法企及的速度扫描代码库、发现逻辑漏洞。对于中国开发者,这意味着:
- 安全测试应优先引入 AI Agent 辅助,尤其在上线前进行深度代码审计
- 同时需警惕 Agent 本身可能引入的新漏洞(如提示注入、数据泄露)
浏览器战争:Agent 原生体验的崛起
传统浏览器竞争焦点是搜索速度与隐私,但新一代浏览器(如 Arc、SigmaOS)正在转向 Agent 原生体验:内置 AI 助手、自动整理标签页、跨应用任务编排。这反映了 Agent 从“聊天窗口”走向“操作系统级能力”的趋势。
对中国市场而言,这一趋势意味着:
- 浏览器可能成为 Agent 的主要入口,类似微信小程序之于移动互联网
- 开发者应关注浏览器扩展 API 对 Agent 的支持程度,提前布局
结论与行动建议
综合以上信号,AI Agent 的能力远未被当前基准测试充分反映。对于中国读者,以下行动建议值得考虑:
- 建立私有评估体系:使用行业特定、未公开的数据集测试 Agent,而非依赖公开基准
- 优化计算预算:在成本可控前提下,为 Agent 分配更多推理时间,观察能力上限
- 拥抱安全自动化:将 AI 漏洞狩猎纳入 CI/CD 流程,同时建立 Agent 安全审计机制
- 关注浏览器生态:选择支持 Agent 原生功能的浏览器,作为用户交互的试验场
AI Agent 的潜力正在从实验室走向生产环境,而低估它可能是 2025 年最大的技术误判。
订阅每周好码简报