中文

立场:编辑大语言模型带来严重安全风险

计算与语言 2025-06-18 v3

摘要

大语言模型 (LLM) 包含大量关于世界的事实。这些事实会随时间推移而过时,这导致了知识编辑方法 (KE) 的发展,这些方法可以改变 LLM 中的特定事实,且副作用有限。本立场论文认为,编辑 LLM 带来了严重的安全风险,而这些风险在很大程度上被忽视了。首先,我们指出 KE 广泛可用、计算成本低、性能高且隐蔽性强,这使其成为恶意行为者的诱人工具。其次,我们讨论了 KE 的恶意用例,展示了 KE 如何能轻易地被用于各种恶意目的。第三,我们强调了 AI 生态系统中允许未经验证地上传和下载更新模型的漏洞。第四,我们认为社会与机构意识的缺乏加剧了这种风险,并讨论了对不同利益相关者的影响。我们呼吁社区 (i) 研究抗篡改模型和对抗恶意模型编辑的对策,以及 (ii) 积极参与保障 AI 生态系统的安全。

引用

@article{arxiv.2502.02958,
  title  = {Position: Editing Large Language Models Poses Serious Safety Risks},
  author = {Paul Youssef and Zhixue Zhao and Daniel Braun and Jörg Schlötterer and Christin Seifert},
  journal= {arXiv preprint arXiv:2502.02958},
  year   = {2025}
}

备注

Accepted at ICML 2025