ExpertQA:专家策划的问题与带出处答案
计算与语言
2024-04-03 v2 人工智能
摘要
随着语言模型被愈发复杂且多元的用户群体所采用,保证其提供事实正确且可由可验证来源支撑的信息,在各研究领域中均至关重要。对于医学与法律等高风险领域尤为如此,其中传播虚假信息的风险很高,并可能导致不良社会后果。以往关于出处与事实性的研究,并未聚焦于分析领域特定场景下语言模型输出的这些特性。本工作中,我们引入领域专家参与,沿出处与事实性的多个维度对若干代表性系统的回复进行人工评估。具体而言,我们收集了来自 32 个研究领域中 484 名参与者的专家策划问题,并请同一批专家评估针对其自身问题的生成回复。此外,我们请专家改进语言模型的回复。我们分析的输出为 ExpertQA,一个高质量的长形式问答数据集,包含跨越 32 个领域的 2177 个问题,以及答案中论断的已验证回答与出处。
引用
@article{arxiv.2309.07852,
title = {ExpertQA: Expert-Curated Questions and Attributed Answers},
author = {Chaitanya Malaviya and Subin Lee and Sihao Chen and Elizabeth Sieber and Mark Yatskar and Dan Roth},
journal= {arXiv preprint arXiv:2309.07852},
year = {2024}
}
备注
Accepted to NAACL 2024. Dataset & code is available at https://github.com/chaitanyamalaviya/expertqa