论文答案中冲突与共识的细粒度评估
计算与语言
2025-08-19 v1
摘要
大型语言模型(Large Language Models, LLMs)在问答(question answering, QA)任务中已显示出强大的性能。然而,多答案问答(Multi-Answer Question Answering, MAQA),即问题可能有多个有效答案的情形,仍然具有挑战性。传统的QA设置通常假设证据之间的一致性,但MAQA可能涉及冲突的答案。构建反映此类冲突的数据集需要大量成本和劳动力,而现有基准常常依赖合成数据、限制于yes/no问题,或应用未经验证的自动标注。在推动该领域研究方面,我们将冲突感知的MAQA设置扩展到要求模型不仅识别所有有效答案,还检测是否存在特定的冲突答案对。为支持这一任务,我们引入一种新型的、成本效益高的、利用事实核查数据集构建NATCONFQA的方法,这是一个新的基准,涵盖真实、冲突感知的MAQA,丰富了详细的冲突标签,用于所有答案对。我们对八个高端LLM在NATCONFQA上的表现进行了评估,揭示了它们在处理各种类型冲突方面的脆弱性以及其来解决冲突的 flawed 策略。
引用
@article{arxiv.2508.12355,
title = {Consensus or Conflict? Fine-Grained Evaluation of Conflicting Answers in Question-Answering},
author = {Eviatar Nachshoni and Arie Cattan and Shmuel Amar and Ori Shapira and Ido Dagan},
journal= {arXiv preprint arXiv:2508.12355},
year = {2025}
}
备注
no comments