语言模型中构造知识的学习与遗忘
计算与语言
2024-10-30 v1 人工智能
摘要
当新的知识被引入训练数据后会发生什么,而大语言模型 (LM) 持续训练期间,这段知识会维持多久?我们通过注入事实到 LM 中并使用新构建的探针数据集 "Outlandish" 来研究此问题,该数据集旨在测试不同类型事实的稳健性。当研究这些记忆的鲁棒性时,在事实新奇性的光谱中似乎存在一个甜点,即与常识保持一致与完全随机之间的位置,此时注入的记忆最持久。具体而言,我们表明,与常识冲突的事实在数万步训练后仍被记住,而与常识不冲突(平凡)的提示,以及被随机乱序的提示则被快速遗忘。进一步地,知识冲突的事实可"引发"语言模型在与逻辑无关的提示上产生幻觉,从而显示其对非目标泛化的倾向,而平凡和随机乱序的事实则引发的幻觉显著较少。最后,我们表明,尽管知识冲突的事实在 LM 中可能持久存在,但可以通过 novel application of multi-step sparse updates 进行大幅抹除,即便在保持模型训练能力的同时也是如此。因此,这一非常简单的方法对缓解训练数据投毒的影响具有直接意义。
引用
@article{arxiv.2410.21750,
title = {Learning and Unlearning of Fabricated Knowledge in Language Models},
author = {Chen Sun and Nolan Andrew Miller and Andrey Zhmoginov and Max Vladymyrov and Mark Sandler},
journal= {arXiv preprint arXiv:2410.21750},
year = {2024}
}