NoiseQA:以用户为中心的问答挑战集评测
计算与语言
2021-02-17 v1
摘要
当问答(QA)系统部署于真实世界时,用户通过多种接口查询它们,例如对语音助手说话、向搜索引擎键入问题,甚至将问题翻译为 QA 系统所支持的语言。尽管社区已投入大量注意力用于假设问题完美构造时从段落中识别正确答案,我们表明,在回答引擎之前流水线中的组件会引入多样且可观的误差来源,即便对于强大的预训练 QA 模型,这些上游噪声源也会使性能大幅退化。我们得出结论:在 QA 系统能有效部署前仍有大量进展空间,强调 QA 评测需扩展以考虑真实世界使用,并希望我们的发现能激发社区对我们系统真正需要为人类所用时所出现问题的更大兴趣。
引用
@article{arxiv.2102.08345,
title = {NoiseQA: Challenge Set Evaluation for User-Centric Question Answering},
author = {Abhilasha Ravichander and Siddharth Dalmia and Maria Ryskina and Florian Metze and Eduard Hovy and Alan W Black},
journal= {arXiv preprint arXiv:2102.08345},
year = {2021}
}
备注
EACL 2021