通过迭代查询生成回答复杂开放域问题
计算与语言
2019-10-17 v1
摘要
当前的单步检索-阅读问答(QA)系统难以回答诸如“'Armada'一书的作者创作的哪部小说将被史蒂文·斯皮尔伯格改编为故事片?”这类问题,因为该问题几乎不包含关于缺失实体(此处指作者)的可检索线索。回答此类问题需要多跳推理,即必须先收集关于缺失实体(或事实)的信息,才能进行进一步推理。我们提出 GoldEn(Gold Entity)Retriever,它在阅读上下文与检索更多支撑文档之间迭代,以回答开放域多跳问题。GoldEn Retriever 不使用不透明且计算昂贵的神经检索模型,而是根据给定的问题和可用上下文生成自然语言搜索查询,并利用现成的信息检索系统查询缺失实体。这使得 GoldEn Retriever 能够高效扩展至开放域多跳推理,同时保持可解释性。我们在近期提出的开放域多跳 QA 数据集 HotpotQA 上评估了 GoldEn Retriever,并证明尽管未使用 BERT 等预训练语言模型,其性能仍优于此前发表的最佳模型。
引用
@article{arxiv.1910.07000,
title = {Answering Complex Open-domain Questions Through Iterative Query Generation},
author = {Peng Qi and Xiaowen Lin and Leo Mehr and Zijian Wang and Christopher D. Manning},
journal= {arXiv preprint arXiv:1910.07000},
year = {2019}
}
备注
EMNLP-IJCNLP 2019. Xiaowen Lin, Leo Mehr, and Zijian Wang contributed equally. GitHub: https://github.com/qipeng/golden-retriever