论LLM忘却中的反事实知识训练隐藏成本
计算与语言
2026-05-27 v1 密码学与安全
摘要
反事实调校(CFT)已成为大型语言模型(LLM)忘却的有前景范式,通过训练模型生成替代的虚构知识以取代不良内容。然而,本文发现该范式在某些方面仍低于其他范式,并识别了这一差距背后的两个先前被忽视的陷阱:(1)知识冲突,where相互不一致的反事实语料库引发冲突的梯度,扰乱参数优化;(2)幻觉溢出,where拟合虚假目标植入持续的虚构偏见,使其在无关领域的幻觉率上升。为系统性诊断这些问题,我们引入RWKU+,一个扩展了新型权衡指标和梯度水平诊断工具的基准。我们的工作进一步讨论了该范式的局限性和开销,旨在为更严谨的LLM忘却研究提供见解和可操作指导。
引用
@article{arxiv.2605.27083,
title = {On the Hidden Costs of Counterfactual Knowledge Training in LLM Unlearning},
author = {Xiaotian Ye and Xiaohan Wang and Mengqi Zhang and Shu Wu},
journal= {arXiv preprint arXiv:2605.27083},
year = {2026}
}