陌生的微调样本控制语言模型的幻觉
机器学习
2024-05-30 v2 人工智能
计算与语言
摘要
众所周知,大型语言模型在面对陌生查询时会产生幻觉,但支配模型产生幻觉的潜在机制尚未被完全理解。在本工作中,我们发现模型微调数据中的陌生样本——即那些引入基础模型知识范围之外概念的样本——对于塑造这些错误至关重要。具体而言,我们发现大型语言模型(LLM)的幻觉预测倾向于模仿与其陌生微调样本相关的响应。这表明,通过修改对陌生微调样本的监督方式,我们可以影响模型对陌生查询的响应(例如,让其回答“我不知道”)。我们在涉及 TriviaQA 和 MMLU 数据集上进行的监督微调(SFT)、强化学习(RL)和奖励模型微调的一系列受控实验中,实证验证了这一观察结果。我们的工作进一步研究了用于提高长文本生成事实性的 RL 微调策略。我们发现,虽然奖励模型的幻觉会显著削弱 RL 事实性微调的有效性,但战略性地控制奖励模型的幻觉可以最小化这些负面影响。利用我们之前关于控制幻觉的观察结果,我们提出了一种学习更可靠奖励模型的方法,并表明它们能提高 RL 事实性微调在长篇幅传记及书籍/电影情节生成任务中的效力。
引用
@article{arxiv.2403.05612,
title = {Unfamiliar Finetuning Examples Control How Language Models Hallucinate},
author = {Katie Kang and Eric Wallace and Claire Tomlin and Aviral Kumar and Sergey Levine},
journal= {arXiv preprint arXiv:2403.05612},
year = {2024}
}