中文

FineDialFact:用于细粒度对话事实验证的基准

计算与语言 2025-08-11 v1

摘要

大型语言模型(LLMs)已知会产生幻觉——即事实不正确或虚构的信息——这对许多自然语言处理(NLP)应用(如对话系统)提出了重大挑战。因此,检测幻觉已成为关键研究领域。当前用于对话系统中幻觉检测的方法主要专注于验证生成响应的事实一致性。然而,这些响应常包含准确、不准确或不可验证的事实,使单一事实标签显得过于简化和粗粒度。本文引入了一个基准数据集FineDialFact,用于细粒度对话事实验证,即验证从对话响应中提取的原子事实。为支持这一目标,我们构建了一个基于公开对话数据集的数据集,并使用各种基线方法进行评估。实验结果表明,包含链式思维(CoT)推理的方法可提高对话事实验证的性能。尽管如此,在开放域对话数据集HybriDialogue上的最佳F1分数仅为0.75,表明该基准对未来研究仍具有挑战性。我们的数据集和代码将在GitHub上公开。

关键词

引用

@article{arxiv.2508.05782,
  title  = {FineDialFact: A benchmark for Fine-grained Dialogue Fact Verification},
  author = {Xiangyan Chen and Yufeng Li and Yujian Gan and Arkaitz Zubiaga and Matthew Purver},
  journal= {arXiv preprint arXiv:2508.05782},
  year   = {2025}
}