中文

使用三编码器模型进行表格与文本的多模态检索

计算与语言 2021-10-20 v2 信息检索

摘要

开放域抽取式问答在文本数据上表现良好,其首先检索候选文本,然后从这些候选中抽取答案。然而,有些问题无法仅通过文本回答,而需要存储在表格中的信息。在本文中,我们提出了一种通过联合将文本、表格和问题编码到单一向量空间中,来检索与问题相关的文本和表格的方法。为此,我们基于相关工作中的文本和表格数据集创建了一个新的多模态数据集,并比较了不同编码方案的检索性能。我们发现,在六个评估数据集中的四个上,transformer模型的稠密向量嵌入优于稀疏嵌入。比较不同的稠密嵌入模型,为每个问题、文本和表格各使用一个编码器的三编码器(tri-encoder),相比为问题和文本表格共用各使用一个编码器的双编码器(bi-encoder),提升了检索性能。我们向社区发布了新创建的多模态数据集,以便用于训练和评估。

关键词

引用

@article{arxiv.2108.04049,
  title  = {Multi-modal Retrieval of Tables and Texts Using Tri-encoder Models},
  author = {Bogdan Kostić and Julian Risch and Timo Möller},
  journal= {arXiv preprint arXiv:2108.04049},
  year   = {2021}
}

备注

Accepted at the 3rd Workshop on Machine Reading for Question Answering (MRQA) at EMNLP 2021