超越记忆:医学知识编辑的严格评估框架
计算与语言
2026-02-17 v4
摘要
最近,知识编辑(KE)作为一种无需完整重新训练即可更新大型语言模型(LLM)中特定事实的 promising方法而涌现。尽管在通用领域基准中效果令人瞩目,但其针对复杂医学领域的适用性仍存大量未探索之处。医学知识编辑尤其具有挑战性,因为它要求LLM内化知识并泛化到未见情景,以实现有效且可解释的决策。在本工作中,我们提出一种新框架MedEditBench,严格评估现有KE方法在医学领域的有效性。在MedEditBench中,我们引入新的医学知识编辑基准以及三种不同的知识编辑范式,这些范式旨在评估不同知识来源对编辑的影响。我们的发现表明,当前KE方法仅实现对注入信息的浅层记忆,无法泛化到新情景。为克服这一局限,我们提出自生成理由编辑(SGR-Edit),该方法利用模型派生的理由作为编辑目标知识,从而揭示 underlying reasoning过程并在现有KE方法之上实现显著改进。此外,我们提供了对医学知识编辑的更深层见解,包括LLMs中医学知识的局部化以及顺序编辑对知识演化的影响。这为在实际医学应用中实施KE方法提供了实用指导。
引用
@article{arxiv.2506.03490,
title = {Beyond Memorization: A Rigorous Evaluation Framework for Medical Knowledge Editing},
author = {Shigeng Chen and Linhao Luo and Zhangchi Qiu and Yanan Cao and Carl Yang and Shirui Pan},
journal= {arXiv preprint arXiv:2506.03490},
year = {2026}
}
备注
Accepted to EACL 2026 Main Conference