面向事实性微调语言模型
计算与语言
2023-11-15 v1 人工智能
机器学习
摘要
大预训练语言模型(LLM)的流畅性与创造性使其被广泛使用,有时甚至替代传统搜索引擎。然而语言模型易于生成令人信服但事实不准确的断言,常被称为“幻觉”。这些错误可能无意中传播错误信息或有害地延续误解。此外,对模型回复的人工事实核查耗时,使得人类事实性标签获取成本高昂。本工作中,我们在无人工标注且针对比过往工作更开放生成设定的情况下,微调语言模型使其更具事实性。我们利用NLP中两项近期关键创新来实现。首先,若干近期工作提出了通过测量与外部知识库的一致性或仅一个大模型置信度分数来判断开放文本事实性的方法。其次,直接偏好优化算法支持使用对可能模型回复的偏好排序,对语言模型进行除监督模仿外目标的直接微调。我们表明,从自动生成的事实性偏好排序(通过现有检索系统或我们新颖的无检索方法生成)中学习,相比RLHF或面向事实性的解码策略,显著提升了Llama-2在留出主题上的事实性(所生成断言中正确的比例)。在7B规模下,相比Llama-2-chat,我们在生成传记和回答医学问题时分别观察到事实错误率降低58%和40%。
引用
@article{arxiv.2311.08401,
title = {Fine-tuning Language Models for Factuality},
author = {Katherine Tian and Eric Mitchell and Huaxiu Yao and Christopher D. Manning and Chelsea Finn},
journal= {arXiv preprint arXiv:2311.08401},
year = {2023}
}