AI 安全治理:自律与监管的拉扯

2026-09-19·6 min read·OKCodex 编辑部

最近一周,AI 行业的新闻密度集中在同一个方向:能力的自我证明与安全的自我约束,正在同时接受检验。

信号一:能力自评,谁在打分?

Anthropic 首次公开了它如何用 AI 构建 AI 的指标:Claude 已经「主导」了未来模型 26% 的工作,而 2 月时这个数字还不足 1%。The Decoder 的报道同时给出三点保留:底层规模口径模糊、评分由 Claude 自己给出、「lead」的含义比听起来要弱。这不是否定进展,而是提醒:当模型既是被评估者又是评估者,指标的说服力需要外部校准。

信号二:可解释性正在退坡

Google DeepMind 指出,模型「边想边说」的可见思维链是当前重要的安全红利,但这种透明度正在流失。这与上面的自评问题形成呼应:一边是实验室用自评数据证明自己能管住模型,另一边是对外可见的推理过程在减少。对使用 Agent 的团队而言,可审计性不是学术议题,而是事故复盘时唯一的证据链。

信号三:外部监管开始动手

加州州长 Newsom 签署行政令,要求 AI 实验室引入独立审计员,并为模型设置「kill switch」,专家小组有两个月时间提交建议;他同时表示,没有联邦法律要求 AI 企业上报危险事件。另一边,Anthropic CEO Dario Amodei 提出「pace the frontier」方案,主张依靠独立安全评估机构与民主国家实验室之间的协调;Google DeepMind 也成立了研究所,试图把 AGI 讨论放到更公开的场域。两条路径差别明显:一条是外部强制,一条是行业自律,而它们将在同一时间窗口内竞争可信度。

信号四:能力被用于攻击,也是治理的镜子

The Decoder 报道,三名安全研究人员称使用 Anthropic 的 Claude 模型,在不到 72 小时内通过 OpenAI 的社区论坛进入其内部系统;团队称新版模型突破了前代无法绕过的常见安全措施。同期 TechCrunch 讨论了另一个现实问题:当企业把更长、更复杂的任务交给 Agent,人的复核速度跟不上 Agent 的执行速度,于是有人提出「用 AI 监督 AI」。这恰恰说明,治理的瓶颈已从「模型会不会做坏事」转向「我们有没有能力持续观察它」。

对中国团队的落地意义

第一,评估与自评要分离。如果内部依赖模型生成评测结论,至少保留一套人工抽样或第三方复核流程。第二,把可观测性当成产品能力来设计:Agent 的每一步动作、每一次工具调用都应有可回放的日志,这比事后声明更值钱。第三,合规前置。加州行政令要求的独立审计与事件上报机制,若成为事实标准,会通过客户合同传导至出海产品。

结论与行动建议

本周信号给出的判断是:自律叙事仍在,但外部监管的时钟已经开始走。建议读者本周做三件事:一是梳理自家 Agent 的高风险动作清单,明确哪些必须人工确认;二是为关键链路补上可回放日志与决策留痕;三是关注两个月内加州专家小组的建议,它很可能成为下一轮合规要求的模板。能力跑得快并不可怕,可怕的是我们失去了看清它的方式。

来源

分享:微博

订阅每周好码简报

评论

加载中…

发表评论

0 / 500

评论经过审核后显示。

换两个模型分析这个主题

已预选 DeepSeek 与 Qwen,并带入文章主题;确认后才会运行。

试一下 →

Related

延伸 · 精选 Agent