Syn-QA2:用合成 QA 数据集评估长尾问题中的虚假前提
计算与语言
2024-03-20 v1
摘要
对信息寻求型问题中虚假前提(或虚假预设)的敏感性对于鲁棒的问答(QA)系统至关重要。近期工作表明,自然出现的问题中的虚假前提对当前模型构成挑战,其在生成式 QA 和简单检测任务上的性能均较低(Kim 等,2023)。然而,现有工作对自然出现问题的关注导致了对可能问题分布长尾部分模型行为分析的空白。为此,我们引入了 Syn-(QA)^2,一组两个合成生成的 QA 数据集:一个使用 Wikidata 的扰动关系生成,另一个通过扰动 HotpotQA(Yang 等,2018)生成。我们评估一系列大型语言模型的发现有三点:(1) QA 中的虚假前提具有挑战性,印证了先前工作的发现;(2) 二元检测任务即使与生成式 QA 本身的难度相比也颇具挑战,可能源于问题的语言结构;(3) 与自然出现的问题相比,检测任务在长尾问题上更具挑战性,凸显了我们合成数据集与生成方法的实用性。
引用
@article{arxiv.2403.12145,
title = {Syn-QA2: Evaluating False Assumptions in Long-tail Questions with Synthetic QA Datasets},
author = {Ashwin Daswani and Rohan Sawant and Najoung Kim},
journal= {arXiv preprint arXiv:2403.12145},
year = {2024}
}
备注
Preprint