DebateQA:评估可辩论知识上的问答
计算与语言
2024-08-05 v1
摘要
大语言模型(LLM)的兴起使我们能够在LLM聊天机器人上寻求对本质上可辩论问题的答案,这需要一种可靠的评估方式。然而,传统的问答基准假设固定答案对此目的而言是不充分的。为此,我们引入了DebateQA,一个包含2941个可辩论问题的数据集,每个问题都附有多个人工标注的部分答案,以捕捉多种视角。我们开发了两种指标:视角多样性,用于评估视角的全面性;以及争议意识,用于评估LLM是否承认问题的可辩论性质。实验表明,两种指标均与人类偏好一致,且在不同底层模型间保持稳定。使用DebateQA及两种指标,我们评估了12种流行的LLM和检索增强生成方法。我们的发现揭示,虽然LLM通常擅长识别可辩论问题,但它们提供涵盖多种视角的全面答案的能力差异显著。
引用
@article{arxiv.2408.01419,
title = {DebateQA: Evaluating Question Answering on Debatable Knowledge},
author = {Rongwu Xu and Xuan Qi and Zehan Qi and Wei Xu and Zhijiang Guo},
journal= {arXiv preprint arXiv:2408.01419},
year = {2024}
}
备注
Dataset and scripts for evaluation are available at https://github.com/pillowsofwind/DebateQA