中文

FLAME:面向大语言模型的事实性对齐

计算与语言 2024-05-03 v1 人工智能

摘要

对齐是微调预训练大语言模型(LLMs)以遵循自然语言指令并作为有用 AI 助手的标准做法。我们注意到常规对齐过程未能提升 LLMs 的事实准确性,反而常导致生成更多虚假事实(即幻觉)。本文研究如何使 LLM 对齐过程更具事实性,首先识别导致幻觉的因素,包括监督微调(SFT)和强化学习(RL)两个步骤。具体而言,我们发现对 LLM 训练新知识或不熟悉文本会促进幻觉。这使得 SFT 较不事实,因为它训练于可能对 LLM 而言是新颖的人类标注数据。此外,标准 RL 的奖励函数也可能鼓励幻觉,因为它引导 LLM 在多样化指令集合上提供更有帮助的响应,往往偏好更长更详细的回答。基于上述观察,我们提出事实性对齐方案,包含事实性 SFT 和通过直接偏好优化实现的事实性 RL。实验表明,我们的事实性对齐方法指导 LLMs 输出更具事实性的响应,同时保持指令遵循能力。

关键词

引用

@article{arxiv.2405.01525,
  title  = {FLAME: Factuality-Aware Alignment for Large Language Models},
  author = {Sheng-Chieh Lin and Luyu Gao and Barlas Oguz and Wenhan Xiong and Jimmy Lin and Wen-tau Yih and Xilun Chen},
  journal= {arXiv preprint arXiv:2405.01525},
  year   = {2024}
}