用于 HotpotQA 的一个简单却强大的流水线
计算与语言
2020-04-16 v1
摘要
最先进的多跳问答模型通常将 BERT 等大规模语言模型与额外的、直观上有用的能力(如命名实体识别、基于图的推理和问句分解)相增强。然而,它们在流行的多跳数据集上的强劲表现是否真的证明了这种增加的设计复杂性是合理的?我们的结果表明答案可能是否定的,因为即便我们基于 BERT 的简单流水线(名为 Quark)也表现得出奇地好。具体而言,在 HotpotQA 上,Quark 在问答和支持句识别两方面均优于这些模型(并且达到了非常接近 RoBERTa 模型的性能)。我们的流水线分为三步:1)使用 BERT 相互独立地识别潜在相关句子;2)将所选句子集合作为上下文输入标准 BERT 跨度预测模型以选择答案;3)使用句子选择模型,结合所选答案,生成支持句。Quark 的强劲表现重新凸显了在利用流行基准证明复杂技术价值之前,仔细探索简单模型设计的重要性。
引用
@article{arxiv.2004.06753,
title = {A Simple Yet Strong Pipeline for HotpotQA},
author = {Dirk Groeneveld and Tushar Khot and Mausam and Ashish Sabharwal},
journal= {arXiv preprint arXiv:2004.06753},
year = {2020}
}