为何新的知识会在 LLM 中产生复杂的涟漪效应?
计算与语言
2025-07-22 v3 人工智能
摘要
大量之前的研究聚焦于后训练知识编辑(KE)以确保语言模型(LM)中的知识保持准确和最新。KE 的一个理想属性和未解之谜是:让编辑后的 LM 正确处理涟漪效应,即 LM 需要准确回答其逻辑相关的知识。在本文中,我们回答了为何大多数 KE 方法仍会产生混乱的涟漪效应的问题。我们进行了广泛的分析,识别出一个显著指标 GradSim,有效揭示更新知识何时以及为何在 LM 中产生涟漪。GradSim 通过计算原始事实及其相关知识梯度之间的余弦相似度得出。我们观察到,在不同的 LM、KE 方法和评估指标之间,涟漪效应性能与 GradSim 之间存在强正相关。进一步的对三种反直觉的失败案例(否定、过度涟漪、多语言)进行调查,表明这些失败常常与 very low GradSim 相关。这一发现验证了 GradSim 是 LM 中何时知识涟漪的有效指标。
引用
@article{arxiv.2407.12828,
title = {Why Does New Knowledge Create Messy Ripple Effects in LLMs?},
author = {Jiaxin Qin and Zixuan Zhang and Manling Li and Pengfei Yu and Heng Ji},
journal= {arXiv preprint arXiv:2407.12828},
year = {2025}
}