中文

ThinkEval:使用基于思维的知识图谱对 LLM 编辑中的知识泄漏进行实用性评估

机器学习 2026-01-19 v3

摘要

鲁棒的模型编辑技术对于在实际应用中部署大型语言模型(LLM)至关重要,因为它们提供了应对隐私泄露、偏见缓解和错误信息传播等挑战的高性价比方法。例如,基于 LLM 的医疗保健助手可能需要更新过时或不正确的知识,以防止有害的建议。然而,许多编辑技术仅关注孤立的事实,这严重地未能防止间接知识泄漏——即通过持续的因果链接和上下文关系意外地重构被编辑删除的信息。为了帮助用户选择正确的编辑技术,我们开发并提出了 ThinkEval,这是一个用于系统量化模型编辑中间接知识泄漏和涟漪效应的框架。ThinkEval 构建并使用专门的知识图谱来分析编辑前后事实的因果结构。为了支持这一方法,我们提出了 KnowGIC,这是一个包含多步推理路径的基准数据集,用于精确测量这些复杂的知识转换效应。我们在多个 LLM 上评估了五种编辑技术:AlphaEdit、RECT、ROME、MEMIT 和 PRUNE。我们的结果表明,这些技术难以在间接事实抑制与相关知识保留之间取得平衡,从而损害了模型知识的上下文完整性。我们的数据集可在以下地址获取:https://github.com/manitbaser/KnowGIC。

关键词

引用

@article{arxiv.2506.01386,
  title  = {ThinkEval: Practical Evaluation of Knowledge Leakage in LLM Editing using Thought-based Knowledge Graphs},
  author = {Manit Baser and Dinil Mon Divakaran and Mohan Gurusamy},
  journal= {arXiv preprint arXiv:2506.01386},
  year   = {2026}
}

备注

Accepted to TMLR