AI Agent 生存战:中国模型为何更务实

2026-06-29·7 min read·OKCodex 编辑部

当“大”不再是唯一答案

2025 年 3 月,新浪微博开源了仅 30 亿参数的 VibeThinker-3B 模型。在数学和编程基准测试中,它居然能与 DeepSeek V3.2、Kimi K2.5 等参数大 333 倍以上的模型掰手腕。这背后不是魔法,而是多阶段后训练(multi-stage post-training)的精心设计。

研究团队提出一个大胆假设:推理能力可以很好地压缩,但事实知识不行。换句话说,小模型在逻辑推理上可以“以小博大”,但想让它记住海量事实,还得靠更大的参数容量。

这一发现对 AI Agent 行业意义深远——Agent 的核心是执行任务链,而非背诵百科全书。

从“答问题”到“干完活”

腾讯联合多所高校的最新综述论文指出,AI 要成为真正的“数字同事”,必须从“生成答案”转向“完成任务”。当前多数模型在 CEO-Bench 测试中表现惨淡:普林斯顿大学让 AI Agent 模拟经营一家软件公司 500 天,结果只有 3 个模型最终盈利,而一个简单的基于规则的启发式方法居然打败了几乎所有 AI。

这揭示了一个尴尬现实:AI Agent 在开放对话中看似聪明,但在持久工作环境中缺乏目标感和闭环能力。腾讯团队认为,关键在于将“对话式交互”与“持久工作空间”结合,让 Agent 能记住上下文、自主规划并执行多步任务。

中国厂商的务实路线

360 创始人周鸿祎最近发布了两款 AI 安全工具,对标 Anthropic 的 Mythos。他坦承中国模型落后西方 20%-30%,但将 Mythos 比作“网络核武器”,呼吁中国必须建立自主防御。360 的工具已发现 3432 个漏洞,证明了实用价值。

更引人注目的是 Coinbase 的转向。其 CEO Brian Armstrong 将系统切换到中国模型如 GLM 5.2 和 Kimi 2.7,通过自动路由和缓存优化,将命中率从 5% 提升到 60%,AI 支出直接减半。这不是“爱国”选择,而是成本效益的理性决策——当西方模型价格高企,中国模型在性价比上提供了真实替代方案。

小模型、大场景

VibeThinker-3B 的成功不是孤例。它验证了一个趋势:在特定 Agent 场景中,小模型经过针对性训练,可以比通用大模型更高效。这对企业部署尤其重要——更小的模型意味着更低的推理成本、更快的响应速度和更好的隐私保护。

与此同时,福特汽车重新雇佣“灰胡子”老工程师,因为 AI 未能达到预期。这提醒我们:AI Agent 不是万能药,它需要与人类经验协同。

结论:给中国读者的行动建议

  1. 重新评估模型选择:不要盲目追求参数规模。针对你的 Agent 任务(如客服、代码生成、数据分析),优先测试 3B-7B 级别的小模型,配合后训练微调。
  2. 关注任务闭环能力:评估 AI Agent 时,不要只看对话流畅度,要设计“持久工作测试”——让 Agent 在模拟环境中运行多天,看它能否完成完整任务链。
  3. 拥抱成本优势:如果业务对成本敏感,积极试用中国开源模型(如 VibeThinker、GLM、Kimi)。它们已在全球顶级企业(如 Coinbase)验证过性价比。
  4. 人机协同而非替代:福特案例说明,AI 是工具,不是答案。保留资深员工的经验判断,让 AI 处理重复性推理,人类负责战略决策。

AI Agent 的竞争,正在从“谁的模型更大”转向“谁的系统更可靠、更便宜、更能完成任务”。中国厂商在这一赛道上,正走在务实而正确的路上。

分享:微博

订阅每周好码简报

评论

加载中…

发表评论

0 / 500

评论经过审核后显示。

换两个模型分析这个主题

已预选 DeepSeek 与 Qwen,并带入文章主题;确认后才会运行。

试一下 →

Mentioned

文中提到的 Agent

AI Agent 生存战:中国模型为何更务实 · OKCodex Blog · 好码未来 OKCodex