零样本开卷问答
计算与语言
2021-11-24 v1 信息检索
机器学习
摘要
开卷问答是问答任务的一个子集,其中系统旨在从给定的一组文档(开卷)以及关于某主题的常见知识中寻找答案。本文提出一种解决方案,用于从亚马逊网络服务(AWS)技术文档语料库中回答自然语言问题,且无需领域特定的标注数据(零样本)。这些问题可具有是否无答案、短答案、长答案或上述任意组合。该解决方案包含一种两步架构:检索器找到正确文档,抽取器在检索到的文档中找到答案。我们引入了一个基于 AWS 技术文档上真实客户问题的开卷问答新测试数据集。在尝试了若干基于抽取式语言模型的信息检索系统与抽取模型后,该解决方案试图在同一次处理中找到是否无答案与文本答案。模型在斯坦福问答数据集 SQuAD(Rajpurkar et al., 2016)与自然问题数据集(Kwiatkowski et al., 2019)上训练。我们能够在无任何领域特定训练的情况下,端到端取得 49% 的 F1 值与 39% 的精确匹配分数(EM)。
引用
@article{arxiv.2111.11520,
title = {Zero-Shot Open-Book Question Answering},
author = {Sia Gholami and Mehdi Noori},
journal= {arXiv preprint arXiv:2111.11520},
year = {2021}
}