中文

陌生的微调样本控制语言模型的幻觉

机器学习 2024-05-30 v2 人工智能 计算与语言

摘要

众所周知,大型语言模型在面对陌生查询时会产生幻觉,但支配模型产生幻觉的潜在机制尚未被完全理解。在本工作中,我们发现模型微调数据中的陌生样本——即那些引入基础模型知识范围之外概念的样本——对于塑造这些错误至关重要。具体而言,我们发现大型语言模型(LLM)的幻觉预测倾向于模仿与其陌生微调样本相关的响应。这表明,通过修改对陌生微调样本的监督方式,我们可以影响模型对陌生查询的响应(例如,让其回答“我不知道”)。我们在涉及 TriviaQA 和 MMLU 数据集上进行的监督微调(SFT)、强化学习(RL)和奖励模型微调的一系列受控实验中,实证验证了这一观察结果。我们的工作进一步研究了用于提高长文本生成事实性的 RL 微调策略。我们发现,虽然奖励模型的幻觉会显著削弱 RL 事实性微调的有效性,但战略性地控制奖励模型的幻觉可以最小化这些负面影响。利用我们之前关于控制幻觉的观察结果,我们提出了一种学习更可靠奖励模型的方法,并表明它们能提高 RL 事实性微调在长篇幅传记及书籍/电影情节生成任务中的效力。

关键词

引用

@article{arxiv.2403.05612,
  title  = {Unfamiliar Finetuning Examples Control How Language Models Hallucinate},
  author = {Katie Kang and Eric Wallace and Claire Tomlin and Aviral Kumar and Sergey Levine},
  journal= {arXiv preprint arXiv:2403.05612},
  year   = {2024}
}