长形式问答中的错误局部化与缓解
计算与语言
2025-06-04 v5
摘要
长形式问答 (LFQA) 旨在提供对复杂问题的详尽和深入的答案,增强理解。然而,这些详细的响应容易产生幻觉和事实不一致,导致其忠实于评估受到挑战。本工作引入HaluQuestQA,这是第一个带有局部化错误注释的幻觉数据集,用于人类撰写和模型生成的LFQA答案。HaluQuestQA包含698个QA对,以及1.8k个span级别的错误注释,涵盖五种不同的错误类型,由专家注释员进行注释,以及偏好判断。使用我们收集的数据,我们全面分析了长形式答案的不足,发现其缺乏完整性并提供无用的参考文献。我们在该数据集上训练一个自动反馈模型,预测带有不完整信息的错误span并提供相关解释。最后,我们提出一种基于提示的方法Error-informed refinement,该方法利用所学反馈模型的信号来细化生成的答案,我们展示在多个模型上该方法显著减少了错误并提高了答案质量。此外,人类认为我们方法生成的答案详尽且高度偏好它们(84%)相对于基线答案。
引用
@article{arxiv.2407.11930,
title = {Localizing and Mitigating Errors in Long-form Question Answering},
author = {Rachneet Sachdeva and Yixiao Song and Mohit Iyyer and Iryna Gurevych},
journal= {arXiv preprint arXiv:2407.11930},
year = {2025}
}
备注
ACL 2025 Findings; Code and data are available: https://github.com/UKPLab/acl2025-lfqa-hallucination