中文

Mr. TyDi:面向稠密检索的多语言基准

计算与语言 2021-11-09 v2 信息检索

摘要

我们提出 Mr. TyDi,一个用于十一种类型学上多样语言单语检索的多语言基准数据集,旨在评估基于学习得到的稠密表示的排序效果。该资源的目的是激发非英语语言中稠密检索技术的研究,其动机是近期观察到现有的表示学习技术在应用于分布外数据时表现不佳。作为起点,我们基于一种多语言适配的 DPR(称为“mDPR”)为该新数据集提供零样本基线。实验表明,尽管 mDPR 的效果远不如 BM25,但稠密表示似乎仍能提供有价值的相关性信号,在稀疏-稠密混合中改善 BM25 的结果。除对结果进行分析外,我们还讨论了未来的挑战并提出了多语言稠密检索的研究议程。Mr. TyDi 可在 https://github.com/castorini/mr.tydi 下载。

关键词

引用

@article{arxiv.2108.08787,
  title  = {Mr. TyDi: A Multi-lingual Benchmark for Dense Retrieval},
  author = {Xinyu Zhang and Xueguang Ma and Peng Shi and Jimmy Lin},
  journal= {arXiv preprint arXiv:2108.08787},
  year   = {2021}
}

备注

Workshop on Multilingual Representation Learning at EMNLP 2021