ASQA:事实型问题遇见长形式答案
计算与语言
2023-01-24 v2
摘要
丰富的数据集与可靠的评测指标推动了事实型问答(QA)的显著进展。然而,这一进展不易迁移到长形式 QA 任务,其目标是回答需要深入解释的问题。障碍包括(i)缺乏高质量数据,以及(ii)缺少对答案质量的明确定义。本工作中,我们通过(i)发布一个称为 ASQA(Answer Summaries for Questions which are Ambiguous,歧义问题的答案摘要)的新数据集与任务;以及(ii)提出衡量 ASQA 性能的可靠指标,来解决这些问题。我们的任务聚焦于有歧义的事实型问题,即依解读不同而有不同正确答案的问题。对歧义问题的答案应将多源事实信息综合为消解歧义的长形式摘要。与现有长形式 QA 任务(如 ELI5)不同,ASQA 承认清晰的正确性概念:面对良好摘要的用户应能够回答原歧义问题的不同解读。我们利用该正确性概念定义 ASQA 的自动化性能指标。我们的分析表明该指标与人类判断一致,并揭示人类表现与强基线间存在显著差距。
引用
@article{arxiv.2204.06092,
title = {ASQA: Factoid Questions Meet Long-Form Answers},
author = {Ivan Stelmakh and Yi Luan and Bhuwan Dhingra and Ming-Wei Chang},
journal= {arXiv preprint arXiv:2204.06092},
year = {2023}
}
备注
A minor bug in computing the ROUGE score was fixed. The fix **did not** result in any changes in observations and conclusions