面向开放域事实型问答的数据集与神经循环序列标注模型
计算与语言
2016-09-02 v2 人工智能
神经与进化计算
摘要
尽管近年来基于神经网络的问答(QA),即神经问答,取得了令人鼓舞的成果,但缺乏大规模真实世界问答数据集仍然是开发和评估神经问答系统面临的挑战。为了缓解这一问题,我们提出了一个大规模人工标注的真实世界问答数据集 WebQA,包含超过 42k 个问题和 556k 条证据。由于现有的神经问答方法将问答视为序列生成或分类/排序问题,它们面临着 softmax 计算开销大、未登录答案处理困难或需要独立的候选答案生成组件等挑战。在本工作中,我们将神经问答转化为一个序列标注问题,并提出了一种端到端的序列标注模型,克服了上述所有挑战。在 WebQA 上的实验结果表明,我们的模型在基于词的输入下显著优于基线,F1 分数达到 74.69%,而在更具挑战性的基于字符的输入下,性能仅下降 3.72 个 F1 点。
引用
@article{arxiv.1607.06275,
title = {Dataset and Neural Recurrent Sequence Labeling Model for Open-Domain Factoid Question Answering},
author = {Peng Li and Wei Li and Zhengyan He and Xuguang Wang and Ying Cao and Jie Zhou and Wei Xu},
journal= {arXiv preprint arXiv:1607.06275},
year = {2016}
}
备注
10 pages, 3 figures, withdraw experimental results on CNN/Daily Mail datasets