AI 安全缺口:开源模型逼近前沿

2026-08-05·6 min read·OKCodex 编辑部

开源模型正在逼近前沿,但安全没有跟上

2026 年,AI 领域的竞争格局正在发生微妙变化。SaferAI 的一份新报告指出,Z.ai 推出的开源权重模型 GLM-5.2 在多项基准测试中已接近前沿闭源模型(如 GPT-5 级别),但在安全缓解措施上存在明显短板。这一发现再次将"开源模型的安全差距"推上风口浪尖。

报告称,GLM-5.2 在推理、编码等任务上表现优异,但缺乏针对有害内容生成、越狱攻击等关键场景的防护。这意味着,虽然开源模型的能力在快速追赶,但它们可能更容易被滥用,成为恶意用途的工具。

为什么开源模型的安全问题更突出?

闭源模型(如 OpenAI 的 GPT 系列、Anthropic 的 Claude)通常在部署前经过大量安全对齐训练,并持续通过红队测试和用户反馈迭代。而开源模型由于权重公开,任何人都可以下载、微调甚至移除安全限制。

SaferAI 的报告指出,GLM-5.2 缺乏多层次的拒绝机制,对提示注入和对抗性攻击的抵抗力较弱。这并非个例——此前 Meta 的 Llama 系列、Mistral 的模型也面临类似批评。但 GLM-5.2 的特殊之处在于,它的能力已经足够强大,接近"前沿"水平,却仍缺乏与之匹配的安全防护。

硅谷的分歧:安全 vs. 开放

这一话题在硅谷引发了激烈争论。上周,《纽约时报》报道称,特朗普政府曾讨论针对中国开源模型的制裁和云禁令,OpenAI 和 Anthropic 支持限制,而 Nvidia、Google、Meta 则强烈反对。最终,华盛顿暂时搁置了相关计划,但分歧并未消失。

支持限制的一方认为,开源模型的安全缺口可能被对手利用,构成国家安全风险。反对者则强调,开源是 AI 创新的基石,过度限制会扼杀生态。Nvidia 甚至在一周内牵头成立了 Open Secure AI Alliance,已有超过 120 家公司加入,专门研究如何防御 AI 代理的攻击。

对中国开发者的启示

对于中国 AI 从业者而言,这份报告和争论有几点直接意义:

  1. 安全不是可选项:如果你在开发或使用开源模型,务必评估其安全基线。GLM-5.2 的能力很诱人,但在部署到生产环境前,需要额外的安全加固,例如加入输入过滤、输出审核、对抗性测试等。

  2. 开源生态需要安全基础设施:目前,开源模型的安全工具链仍不成熟。Nvidia 的联盟和 SaferAI 这类机构正在推动标准,但中国开发者也可以主动参与,甚至构建自己的安全层。

  3. 合规风险在增加:随着中美在 AI 领域的博弈加剧,开源模型的跨境使用可能面临更多限制。企业应提前规划,避免依赖单一模型或地区。

结论:能力与安全必须同步发展

开源模型的能力追赶是好事,但如果安全差距持续存在,将给整个行业带来风险。对于开发者,我的建议是:在选择开源模型时,不要只看基准分数,还要看它的安全文档和已知漏洞;在部署前,务必进行针对性的安全测试。

安全不是发布后的补丁,而是模型生命周期的组成部分。只有能力与安全同步发展,AI 才能真正造福社会。

分享:微博

Subscribe to weekly briefing

评论

加载中…

发表评论

0 / 500

评论经过审核后显示。

换两个模型分析这个主题

已预选 DeepSeek 与 Qwen,并带入文章主题;确认后才会运行。

试一下 →

Related

延伸 · 精选 Agent