中文

错误答案也有用处:带有答案可信度评分的PlausibleQA大规模QA数据集

计算与语言 2025-04-22 v2 信息检索

摘要

大型语言模型(LLM)正在革新信息检索领域,聊天机器人已成为重要的用户查询答案来源。由于LLM设计优先生成正确答案,可信但错误的候选答案价值常被忽视。然而,这些答案在诸如多选题问答(MCQA)和问答鲁棒性评估(QARA)等任务中仍具实用价值。现有QA数据集主要聚焦正确答案,未充分考虑其他候选答案的可信度,限制了模型评估的细粒度。为填补这一空白,我们引入PlausibleQA——包含10,000个问题和100,000个候选答案的数据集,每个答案均标注可信度分数及选择依据。此外,数据集包含900,000个用于两两比较候选答案的依据,进一步细化可信度评估。我们通过人类评估和实证实验评估PlausibleQA,证明其在MCQA和QARA分析中的实用性。我们的发现表明,可信度感知方法在MCQA干扰项生成和QARA中有效。我们发布PlausibleQA作为QA研究资源,提升LLM在区分可信干扰项与正确答案方面的性能。

关键词

引用

@article{arxiv.2502.16358,
  title  = {Wrong Answers Can Also Be Useful: PlausibleQA -- A Large-Scale QA Dataset with Answer Plausibility Scores},
  author = {Jamshid Mozafari and Abdelrahman Abdallah and Bhawna Piryani and Adam Jatowt},
  journal= {arXiv preprint arXiv:2502.16358},
  year   = {2025}
}

备注

Accepted at SIGIR 2025