中文

恶意知识编辑下知识密集型推理的安全性风险评估

人工智能 2026-05-12 v1 密码学与安全

摘要

大型语言模型(LLMs)越来越依赖知识编辑来支持知识密集型推理,但这种灵活性也引入了严重的安全风险:攻击者可以注入恶意或误导性知识,从而破坏下游推理并导致有害后果。现有的知识编辑基准主要关注编辑有效性,缺乏一个统一的框架来系统评估被编辑知识对推理行为的安全性影响。为了填补这一空白,我们提出了 EditRisk-Bench,一个用于系统评估恶意知识编辑下知识密集型推理安全风险的基准。与主要强调编辑成功率、泛化性和局部性的现有基准不同,EditRisk-Bench 关注注入的知识如何影响下游推理行为和可靠性。它在一个统一的评估框架中整合了多种恶意场景(包括错误信息、偏见和安全违规),以及多级知识密集型推理任务和代表性编辑策略,用于衡量攻击有效性、推理正确性和副作用。在开源和闭源 LLMs 上的大量实验表明,恶意知识编辑能够可靠地诱发错误或不安全的推理,同时很大程度上保留通用能力,使得此类风险难以被检测。我们进一步识别了影响这些风险的几个关键因素,包括编辑规模、知识特征和推理复杂度。EditRisk-Bench 为理解和缓解 LLMs 知识编辑中的安全风险提供了一个可扩展的测试平台。

关键词

引用

@article{arxiv.2605.10146,
  title  = {Benchmarking Safety Risks of Knowledge-Intensive Reasoning under Malicious Knowledge Editing},
  author = {Qinghua Mao and Xi Lin and Jinze Gu and Jun Wu and Siyuan Li and Yuliang Chen},
  journal= {arXiv preprint arXiv:2605.10146},
  year   = {2026}
}