中文

利用词级知识进行神经跨语言信息检索的混合注意力Transformer

信息检索 2021-09-16 v2 计算与语言

摘要

预训练上下文表示在许多下游任务(包括文档排序)中取得了巨大成功。此类预训练表示的多语言版本为使用同一模型联合学习多种语言提供了可能。尽管人们期望这种联合训练能带来巨大收益,但在跨语言信息检索(CLIR)中,多语言设置下的模型并未达到单语言设置下模型的同等性能水平。我们假设性能下降是由于查询与文档之间的翻译鸿沟所致。在单语言检索任务中,由于词法输入相同,模型更容易识别出现在文档中的查询词项。然而,在多语言预训练模型中,不同语言的词被投影到同一超空间中,模型倾向于将查询词项翻译成相关词项,即出现在相似上下文中的词项,而非(或有时取代)目标语言中的同义词。这一特性给模型连接查询和文档中共同出现的词项带来了困难。为解决此问题,我们提出了一种新颖的混合注意力Transformer(MAT),其融入了外部词级知识,如词典或翻译表。我们设计了一种三明治式架构,将MAT嵌入到近期基于Transformer的深度神经模型中。通过将翻译知识编码进注意力矩阵,带有MAT的模型能够聚焦于输入序列中相互翻译的词。实验结果证明了外部知识的有效性,以及嵌入MAT的神经重排序模型在CLIR任务上的显著提升。

关键词

引用

@article{arxiv.2109.02789,
  title  = {Mixed Attention Transformer for Leveraging Word-Level Knowledge to Neural Cross-Lingual Information Retrieval},
  author = {Zhiqi Huang and Hamed Bonab and Sheikh Muhammad Sarwar and Razieh Rahimi and James Allan},
  journal= {arXiv preprint arXiv:2109.02789},
  year   = {2021}
}