对 LLM 进行新知识微调会鼓励幻觉吗?
计算与语言
2024-10-02 v3
摘要
当大型语言模型通过监督式微调进行对齐时,它们可能会遇到这种 pre-training 中未获取的新事实信息。人们经常推测这会教会模型产生幻觉,以至于生成事实错误的响应,因为模型被训练来生成那些并不基于其 pre-existing 知识的事实。在本工作中,我们研究了这种对新知识的暴露如何影响 fine-tuned 模型利用其 pre-existing 知识的能力。为此,我们设计了一个受控环境,聚焦于闭卷问答任务,通过调整引入新知识的 fine-tuning 示例所占的比例来进行研究。我们展示了大型语言模型在通过微调获取新事实知识方面存在困难,因为引入新知识的 fine-tuning 示例的学习速度显著慢于那些与模型知识相符的示例。然而,我们也发现,随着引入新知识的示例最终被学习,它们线性增加模型产生幻觉的倾向。综上所述,我们的结果凸显了通过微调引入新事实知识的风险,并支持该观点:大型语言模型主要通过 pre-training 获取事实知识,而 fine-tuning 则教会它们更有效地使用这些知识。
引用
@article{arxiv.2405.05904,
title = {Does Fine-Tuning LLMs on New Knowledge Encourage Hallucinations?},
author = {Zorik Gekhman and Gal Yona and Roee Aharoni and Matan Eyal and Amir Feder and Roi Reichart and Jonathan Herzig},
journal= {arXiv preprint arXiv:2405.05904},
year = {2024}
}
备注
Accepted as a long paper at EMNLP 2024