AI Agent 成本战:何时比人贵?

2026-07-28·6 min read·OKCodex 编辑部

AI Agent 成本战:何时比人贵?

AI Agent 正在从实验室走向企业生产环境,但一个根本问题始终悬而未决:用 AI Agent 替代人类工作,到底划不划算?

最近,非营利研究机构 METR 发布了一项新指标——「支出视界」(expenditure horizon),试图用美元数字精确衡量 AI Agent 在解决问题时的成本效益。早期测试结果并不乐观:在 NanoGPT 速度跑分任务中,AI Agent 的成本效率远低于人类。

与此同时,微软推出了自研网络安全模型 MAI-Cyber-1-Flash,并嵌入多 Agent 系统 MDASH,声称成本比纯前沿模型降低 50%。OpenAI 则发布报告称,超过 43.5% 的职场 ChatGPT 查询涉及「跨职业任务」,暗示 AI 正在模糊岗位边界。

这些信号交织在一起,指向一个关键问题:中国企业在拥抱 AI Agent 时,该如何评估和优化成本?

METR 的「支出视界」:一个有用的标尺

METR 的「支出视界」定义很简单:AI Agent 在完成一个任务时,累计消耗的计算资源(折算成美元)达到人类完成该任务所需工资的那一刻。 超过这个时间点,AI 就比人贵了。

早期测试中,AI Agent 在 NanoGPT 速度跑分上的表现「令人失望」——它们需要消耗大量计算资源才能达到人类水平。METR 也承认,该指标有盲点:

  • 它未考虑 AI 可以 24/7 不间断工作的优势
  • 未计入人类培训、福利、管理成本
  • 新一代模型(如 GPT-5.4、Kimi K3)可能大幅改变结果

尽管如此,这个指标提供了一个清晰的思考框架:在部署 AI Agent 前,先算一笔账。

微软的务实策略:分层 Agent 架构

微软的 MAI-Cyber-1-Flash 模型给出了一个值得借鉴的解决方案。该模型在 CyberGym 基准测试中达到 96% 的得分,但微软并没有让它独立处理所有任务。

在 MDASH 多 Agent 系统中,MAI-Cyber-1-Flash 处理常规安全任务,只有最复杂的情况才会传递给 GPT-5.4。微软宣称,这种分层架构可将成本降低 50%。

这背后的逻辑是:不是所有任务都需要最强大的模型。 对于中国企业而言,这意味着:

  1. 任务分级:将企业流程拆解为简单、中等、复杂三类
  2. 模型匹配:简单任务用轻量模型(如 Kimi K3 的开源版本),复杂任务调用前沿模型
  3. 成本监控:建立类似「支出视界」的内部指标,定期审计

OpenAI 的数据:AI 正在重塑工作边界

OpenAI 分析了超过 80 万条与工作相关的 ChatGPT 消息,发现 43.5% 的查询涉及「其他职业的任务」。例如,营销人员使用 ChatGPT 编写代码,工程师用它撰写文案。

这种现象在中小企业尤为明显。OpenAI 称之为「任务跨界」(task crossover)。这暗示:AI Agent 的真正价值可能不在于替代某个岗位,而在于让每个人都能处理跨领域任务。

对于中国企业,这意味着:

  • 培训成本降低:员工无需精通多个领域,AI Agent 可以充当即时专家
  • 组织扁平化:小团队可以完成过去需要多个部门协作的任务
  • 新风险:过度依赖 AI 可能导致核心能力退化

中国视角:Kimi K3 开源带来的机会

月之暗面(Moonshot AI)最近开源了 Kimi K3 的模型权重和部分基础设施。该模型在主流基准测试上几乎与 GPT-5.6 Sol 和 Fable 5 持平,但在网络安全和数学任务上存在明显差距。

对于中国企业,Kimi K3 的开源意味着:

  • 低成本实验:企业可以在内部部署 Kimi K3,构建定制 Agent,无需支付 API 费用
  • 领域微调:针对特定行业(如金融、制造)进行微调,弥补通用模型在专业领域的不足
  • 数据安全:敏感数据不必上传至云端,可在本地运行

但需注意:独立测试显示 Kimi K3 在安全任务上表现不佳。如果企业计划部署涉及敏感数据的 Agent,需要额外构建安全层。

结论:给中国读者的行动建议

AI Agent 的成本效率正在快速提升,但「何时比人贵」没有统一答案。以下是四条具体建议:

  1. 建立自己的「支出视界」指标:根据行业平均工资和模型 API 价格,计算每个任务的 AI 成本上限。

  2. 采用分层 Agent 架构:参考微软 MDASH 的做法,让轻量模型处理 80% 的常规任务,只将 20% 的复杂任务交给前沿模型。

  3. 拥抱开源模型:Kimi K3 等开源模型为中小企业提供了低成本入口。优先在内部部署,积累经验后再考虑云端扩展。

  4. 警惕「任务跨界」陷阱:AI 让每个人都能做别人的工作,但企业仍需确保核心岗位的专业性不被稀释。

最终,AI Agent 的胜利不是技术的胜利,而是成本效率的胜利。 谁能用更少的钱完成更多的任务,谁就能在下一轮竞争中占据优势。

分享:微博

Subscribe to weekly briefing

评论

加载中…

发表评论

0 / 500

评论经过审核后显示。

换两个模型分析这个主题

已预选 DeepSeek 与 Qwen,并带入文章主题;确认后才会运行。

试一下 →

Related

延伸 · 精选 Agent