HybridQA:一个基于表格与文本数据的多跳问答数据集
计算与语言
2021-05-13 v3 人工智能
摘要
现有的问答数据集侧重于处理同质信息,仅基于文本或仅基于知识库/表格信息。然而,由于人类知识分布于异质形式中,仅使用同质信息可能导致严重的覆盖问题。为填补这一空白,我们提出 HybridQA https://github.com/wenhuchen/HybridQA,一个需要基于异质信息进行推理的新大规模问答数据集。每个问题与一张维基百科表格以及多个与表中实体相链接的自由文本语料对齐。问题被设计为聚合表格信息与文本信息,即缺少任一形式都将使问题无法回答。我们测试了三种不同模型:1)仅表格模型;2)仅文本模型;3)结合异质信息寻找答案的混合模型。实验结果表明,两个基线获得的 EM 分数低于 20\%,而混合模型可实现超过 40\% 的 EM。这一差距表明在 HybridQA 中聚合异质信息的必要性。然而,混合模型的分数仍远落后于人类表现。因此,HybridQA 可作为一个具有挑战性的基准,用于研究基于异质信息的问答。
引用
@article{arxiv.2004.07347,
title = {HybridQA: A Dataset of Multi-Hop Question Answering over Tabular and Textual Data},
author = {Wenhu Chen and Hanwen Zha and Zhiyu Chen and Wenhan Xiong and Hong Wang and William Wang},
journal= {arXiv preprint arXiv:2004.07347},
year = {2021}
}
备注
Accepted to Proceedings of EMNLP 2020 (Findings)