Web规模下的原位答案句选择
计算与语言
2022-01-19 v1
摘要
当前应用于开放域问答(ODQA)的答案句选择(AS2)通过排序从检索文本中提取的大量可能候选(即句子)来选取答案。在本文中,我们提出基于段落的原位抽取答案句(PEASI),一种为Web规模场景优化的AS2新设计,其无需逐个处理每个候选即可计算答案。具体而言,我们设计了一个基于Transformer的框架,联合(i)对为问题检索到的段落重新排序,以及(ii)从顶部段落中原位识别可能答案。我们在多任务学习框架下训练PEASI,以鼓励各组件(段落重排器与基于段落的答案句抽取器)之间的特征共享。为便于开发,我们构建了一个新的Web来源大规模QA数据集,包含针对60,000多个问题的800,000多个带标注段落/句子。实验表明,我们提出的设计在准确率上以6.51%有效优于当前AS2的最优设定,即独立排序句子的逐点模型,从48.86%提升至55.37%。此外,PEASI在计算答案句时极为高效,仅需约20%的推理量,而标准设定需重排所有候选。我们相信PEASI及其数据集与所提设计的发布,能推动Web规模问答服务部署的研究与开发。
引用
@article{arxiv.2201.05984,
title = {In Situ Answer Sentence Selection at Web-scale},
author = {Zeyu Zhang and Thuy Vu and Alessandro Moschitti},
journal= {arXiv preprint arXiv:2201.05984},
year = {2022}
}