面向开放域问答中表格与文本联合检索的混合模态表示学习与预训练
计算与语言
2022-10-14 v1 人工智能
信息检索
摘要
从表格和文本资源中检索证据对于开放域问答 (OpenQA) 至关重要,能够提供更全面的信息。然而,由于表格与文本差异以及数据稀疏问题的挑战,训练有效的密集表格-文本检索器十分困难。为应对上述挑战,我们引入了优化的开放域问答表格-文本检索器 (OTTeR),以联合检索表格和文本证据。首先,我们提出通过两种机制增强混合模态表示学习:模态增强表示和混合模态负采样策略。其次,为缓解数据稀疏问题并增强通用检索能力,我们进行了以检索为中心的混合模态合成预训练。实验结果表明,OTTeR 在 OTT-QA 数据集上显著提升了表格与文本检索的性能。综合分析检验了所有提出机制的有效性。此外,配备 OTTeR 后,我们的 OpenQA 系统在下游问答任务上取得了 SOTA 结果,在精确匹配方面较此前最佳系统实现了 10.1% 的绝对提升。所有代码和数据均可在 https://github.com/Jun-jie-Huang/OTTeR 获取。
引用
@article{arxiv.2210.05197,
title = {Mixed-modality Representation Learning and Pre-training for Joint Table-and-Text Retrieval in OpenQA},
author = {Junjie Huang and Wanjun Zhong and Qian Liu and Ming Gong and Daxin Jiang and Nan Duan},
journal= {arXiv preprint arXiv:2210.05197},
year = {2022}
}
备注
Accepted to Findings of EMNLP 2022