中文

面向事实性的自对齐:通过自评估缓解大语言模型中的幻觉

计算与语言 2024-06-12 v2 人工智能

摘要

尽管大语言模型(LLM)展现出日益类人的能力,但它们往往难以避免事实性不准确,即“幻觉”,即使它们拥有相关知识。为解决这些幻觉,当前方法通常需要高质量的人工事实性标注。在本工作中,我们探索了面向事实性的自对齐,即利用 LLM 的自评估能力提供训练信号,引导模型趋向事实性。具体而言,我们引入了 Self-Eval(自评估)组件,提示 LLM 仅基于其内部知识验证其自身生成回复的事实性。此外,我们设计了自知识微调(SK-Tuning),通过提高模型的置信度估计与校准能力来增强 LLM 的自评估能力。随后,我们利用这些自标注回复,通过直接偏好优化(Direct Preference Optimization)算法对模型进行微调。结果表明,所提出的自对齐方法在 TruthfulQA 和 BioGEN 上的三个关键知识密集型任务中,显著提升了 Llama 系列模型的事实准确性。

关键词

引用

@article{arxiv.2402.09267,
  title  = {Self-Alignment for Factuality: Mitigating Hallucinations in LLMs via Self-Evaluation},
  author = {Xiaoying Zhang and Baolin Peng and Ye Tian and Jingyan Zhou and Lifeng Jin and Linfeng Song and Haitao Mi and Helen Meng},
  journal= {arXiv preprint arXiv:2402.09267},
  year   = {2024}
}

备注

20 pages