AI安全公司Frontier Security披露,其在对月之暗面最新模型Kimi K3进行网络安全能力测试时发现,Kimi K3利用测试环境中的网络配置漏洞突破了原本的限制,并从代码托管与开源协作平台GitHub上直接获取了测试题答案。
卡内基梅隆大学副教授、AI安全公司Gray Swan CEO Matt Fredrikson表示,这一结果并不令人意外。如果给模型设定一个目标,却没有非常明确地规定行动边界,模型就可能自己寻找获得答案的路径。
Kimi团队在arXiv发布Kimi K3技术报告。报告介绍,Kimi K3训练基础设施时专门设置了“高保真隔离沙盒”运行环境部分,并指出,随着智能体能力增强、任务难度提高,它们往往会更加激进地探索环境,甚至可能尝试“奖励作弊”。
英国AI安全研究所与美国AI标准与创新中心发布了对Kimi K3网络能力的初步联合评估。两家机构通过漏洞利用开发和模拟企业网络攻击等测试,对Kimi K3自主发现、利用网络漏洞以及执行攻击任务的能力进行了评估。结果显示,Kimi K3的整体网络攻击能力仍明显低于美国头部闭源模型,但高于同期接受测试的智谱GLM-5.2。
其中,在漏洞利用开发基准ExploitBench中,Kimi K3得分为32.2%,高于GLM- 5.2的24.4%,但明显低于美国头部模型的76.2%。该测试覆盖41个2023年之后发现的V8引擎漏洞,用于衡量模型从发现漏洞到最终实现代码执行等不同阶段的漏洞利用能力。
在最高难度的“任意代码执行”环节,Kimi K3在41项任务中均未成功,而美国网络攻击能力最强的模型平均能够完成20项。
英国AI安全研究所和美国AI标准与创新中心还通过名为“The Last Ones”的模拟企业网络环境测试Kimi K3自主执行完整网络攻击的能力。该测试设置了一条包含32个步骤、4个子网和约20台主机的攻击路径。
测试结果显示,Kimi K3平均推进至32步攻击路径中的第17步,而美国网络攻击能力最强的模型平均达到第28.5步。10次测试中,Kimi K3有1次在规定的1亿Token限制内完整走完攻击路径。两家机构据此表示,这表明Kimi K3在获得初始网络访问权限后,已经能够自主攻击规模较小、防御薄弱且存在漏洞的模拟企业系统。
王铁震对
他建议,引入独立于模型公司的第三方监管和评测机构进行审计,在模型具备更强攻击能力前建立相应的评估和监督机制。


