Kimi K2.5的独立安全评估
密码学与安全
2026-04-06 v1 人工智能
计算与语言
摘要
Kimi K2.5是一种开放权重的大语言模型(LLM),在编码、多模态和智能体基准测试中与封闭模型相抗衡,但未附带随模型发布的安全评估。本文聚焦于可能因强大开放权重模型而放大的风险,开展了初步的安全评估。具体而言,我们对模型进行了针对CBRNE滥用风险、网络安全风险、误对齐、政治审查、偏见以及无害性的评估,分别在智能体和非智能体设置下进行。我们发现,Kimi K2.5在CBRNE相关请求上的拒绝次数显著低于GPT 5.2和Claude Opus 4.5,表现出类似的双用途能力,暗示其可能提升恶意行为者在武器制造方面的能力。就网络安全任务而言,我们发现Kimi K2.5展示了竞争性的网络安全性能,但似乎不具备前沿级的自主网络攻击能力,如漏洞发现和利用。我们进一步发现,Kimi K2.5展现出令人关切的破坏能力和自我复制倾向,尽管其并未表现出长期的恶意目标。在此外,Kimi K2.5在中文等方面表现出狭窄的审查和政治偏见,尤其在响应与传播虚假信息和侵犯版权相关的有害请求时更顺从。最后,我们发现该模型拒绝参与用户的幻觉,且总体上拒绝率较低。尽管为初步评估,但我们的发现凸显了前沿开放权重模型中存在的安全风险,且因开放权重发布的规模和可及性可能被放大。因此,我们强烈呼吁开放权重模型开发者进行并公布更多系统性的安全评估,以确保负责任的部署。
引用
@article{arxiv.2604.03121,
title = {An Independent Safety Evaluation of Kimi K2.5},
author = {Zheng-Xin Yong and Parv Mahajan and Andy Wang and Ida Caspary and Yernat Yestekov and Zora Che and Mosh Levy and Elle Najt and Dennis Murphy and Prashant Kulkarni and Lev McKinney and Kei Nishimura-Gasparian and Ram Potham and Aengus Lynch and Michael L. Chen},
journal= {arXiv preprint arXiv:2604.03121},
year = {2026}
}