中文

教旧法新招:利用零样本学习复兴多语言检索

信息检索 2020-05-01 v1 计算与语言 机器学习

摘要

尽管每天有数十亿非英语用户依赖搜索引擎,但面向非英语语言的临时信息检索问题却很少被研究。这主要是由于缺乏适合训练排序算法的数据集。在本文中,我们通过利用预训练的多语言语言模型,将基于英语语料库训练的检索系统迁移到非英语查询与文档上,从而解决数据缺失问题。我们的模型在零样本设定下评估,即使用它们为训练期间从未见过的语言中的查询-文档对预测相关性分数。我们的结果表明,所提出的方法能显著优于阿拉伯语、汉语普通话和西班牙语上的无监督检索技术。我们还表明,用目标语言的一些样例扩充英语训练语料库有时能提升性能。

关键词

引用

@article{arxiv.1912.13080,
  title  = {Teaching a New Dog Old Tricks: Resurrecting Multilingual Retrieval Using Zero-shot Learning},
  author = {Sean MacAvaney and Luca Soldaini and Nazli Goharian},
  journal= {arXiv preprint arXiv:1912.13080},
  year   = {2020}
}

备注

ECIR 2020 (short)