中文

借助合成负样本的教学 DPO:用于幻觉检测

计算与语言 2025-05-26 v1 人工智能

摘要

将大型语言模型 (LLM) 对齐以准确检测幻觉仍是一个重大挑战,由于幻觉文本的复杂性。我们认识到,幻觉样本通常比传统负样本更具欺骗性,因而将这些精心设计的幻觉样本作为 DPO 对齐程序中的负样本。我们的方法采用课程学习策略,逐步过渡训练,从基于独立事实检查模型得出最大概率得分减少量识别的更易样本,到逐渐更难的样本。这种结构化的难度扩展确保了稳定且渐进的学习。实验评估表明,我们的HaluCheck模型采用课程 DPO 方法并使用高质量负样本训练,在各种指标上显著提高模型性能,在像 MedHallu 和 HaluEval 这类困难基准上实现提升最高可达 24%。此外,HaluCheck模型在零样本设置下表现出色,在各种基准测试中均显著优于更大的 SOTA 模型。

关键词

引用

@article{arxiv.2505.17558,
  title  = {Teaching with Lies: Curriculum DPO on Synthetic Negatives for Hallucination Detection},
  author = {Shrey Pandit and Ashwin Vinod and Liu Leqi and Ying Ding},
  journal= {arXiv preprint arXiv:2505.17558},
  year   = {2025}
}

备注

Code and dataset are available at https://teachingwithlies.github.io/