FactCHD:事实冲突幻觉检测基准
计算与语言
2024-05-28 v3 人工智能
计算机视觉与模式识别
信息检索
机器学习
摘要
尽管LLMs具有令人印象深刻的生成能力,但在现实应用中受限于事实冲突幻觉。准确识别LLMs生成文本中的幻觉,尤其在复杂推理场景中,是一个相对未被充分探索的领域。为弥补这一空白,我们提出FactCHD,一个专为检测LLMs事实冲突幻觉而设计的基准。FactCHD具有涵盖多种事实性模式(包括 vanilla、多跳、比较和集合操作)的多样化数据集。FactCHD的一个独特要素是其集成了基于事实的证据链,显著增强了评估检测器解释的深度。在不同LLMs上的实验暴露了当前方法在准确检测事实错误方面的不足。此外,我们引入了Truth-Triangulator,它通过工具增强的ChatGPT和基于Llama2的LoRA微调综合反思性考量,旨在通过预测结果与证据的融合产生更可信的检测。基准数据集可在 https://github.com/zjunlp/FactCHD 获取。
引用
@article{arxiv.2310.12086,
title = {FactCHD: Benchmarking Fact-Conflicting Hallucination Detection},
author = {Xiang Chen and Duanzheng Song and Honghao Gui and Chenxi Wang and Ningyu Zhang and Yong Jiang and Fei Huang and Chengfei Lv and Dan Zhang and Huajun Chen},
journal= {arXiv preprint arXiv:2310.12086},
year = {2024}
}
备注
IJCAI 2024