AI 安全缺口:开源模型逼近前沿
开源模型正在逼近前沿,但安全没有跟上
2026 年,AI 领域的竞争格局正在发生微妙变化。SaferAI 的一份新报告指出,Z.ai 推出的开源权重模型 GLM-5.2 在多项基准测试中已接近前沿闭源模型(如 GPT-5 级别),但在安全缓解措施上存在明显短板。这一发现再次将"开源模型的安全差距"推上风口浪尖。
报告称,GLM-5.2 在推理、编码等任务上表现优异,但缺乏针对有害内容生成、越狱攻击等关键场景的防护。这意味着,虽然开源模型的能力在快速追赶,但它们可能更容易被滥用,成为恶意用途的工具。
为什么开源模型的安全问题更突出?
闭源模型(如 OpenAI 的 GPT 系列、Anthropic 的 Claude)通常在部署前经过大量安全对齐训练,并持续通过红队测试和用户反馈迭代。而开源模型由于权重公开,任何人都可以下载、微调甚至移除安全限制。
SaferAI 的报告指出,GLM-5.2 缺乏多层次的拒绝机制,对提示注入和对抗性攻击的抵抗力较弱。这并非个例——此前 Meta 的 Llama 系列、Mistral 的模型也面临类似批评。但 GLM-5.2 的特殊之处在于,它的能力已经足够强大,接近"前沿"水平,却仍缺乏与之匹配的安全防护。
硅谷的分歧:安全 vs. 开放
这一话题在硅谷引发了激烈争论。上周,《纽约时报》报道称,特朗普政府曾讨论针对中国开源模型的制裁和云禁令,OpenAI 和 Anthropic 支持限制,而 Nvidia、Google、Meta 则强烈反对。最终,华盛顿暂时搁置了相关计划,但分歧并未消失。
支持限制的一方认为,开源模型的安全缺口可能被对手利用,构成国家安全风险。反对者则强调,开源是 AI 创新的基石,过度限制会扼杀生态。Nvidia 甚至在一周内牵头成立了 Open Secure AI Alliance,已有超过 120 家公司加入,专门研究如何防御 AI 代理的攻击。
对中国开发者的启示
对于中国 AI 从业者而言,这份报告和争论有几点直接意义:
-
安全不是可选项:如果你在开发或使用开源模型,务必评估其安全基线。GLM-5.2 的能力很诱人,但在部署到生产环境前,需要额外的安全加固,例如加入输入过滤、输出审核、对抗性测试等。
-
开源生态需要安全基础设施:目前,开源模型的安全工具链仍不成熟。Nvidia 的联盟和 SaferAI 这类机构正在推动标准,但中国开发者也可以主动参与,甚至构建自己的安全层。
-
合规风险在增加:随着中美在 AI 领域的博弈加剧,开源模型的跨境使用可能面临更多限制。企业应提前规划,避免依赖单一模型或地区。
结论:能力与安全必须同步发展
开源模型的能力追赶是好事,但如果安全差距持续存在,将给整个行业带来风险。对于开发者,我的建议是:在选择开源模型时,不要只看基准分数,还要看它的安全文档和已知漏洞;在部署前,务必进行针对性的安全测试。
安全不是发布后的补丁,而是模型生命周期的组成部分。只有能力与安全同步发展,AI 才能真正造福社会。
Subscribe to weekly briefing