打破链条:解构多跳知识忘卸中的链接
计算与语言
2024-10-18 v1
摘要
大型语言模型(LLM)作为巨大的信息存储库,往往包含个人或受版权保护的数据,重新从头训练它们并不是一个可行的选项。这导致各种快速、近似的忘卸技术发展出来,以从LLM中选择性地删除知识。先前的研究主要集中于通过反转语言建模目标来最小化特定标记序列的概率,以实现知识的删除。然而,这些方法仍使LLM面临针对间接引用的对抗性攻击。本文检查了当前忘卸技术在有效抹去特定类型间接提示方面的局限性,即多跳查询。我们的发现表明,现有方法在删除一个中间跳跃被忘卸后,仍无法完全删除多跳知识。为解决这一问题,我们提出MUNCH—a一种简单的基于不确定性的方法,将多跳查询分解为子问题,并利用忘卸模型在最终决策中的不确定性。实证结果表明,我们的框架有效,MUNCH可以轻松集成到现有忘卸技术中,使其成为一种灵活且有用的解决方案,用于增强忘卸过程。
引用
@article{arxiv.2410.13274,
title = {Breaking Chains: Unraveling the Links in Multi-Hop Knowledge Unlearning},
author = {Minseok Choi and ChaeHun Park and Dohyun Lee and Jaegul Choo},
journal= {arXiv preprint arXiv:2410.13274},
year = {2024}
}
备注
16 pages, 5 figures