中文

面向鲁棒神经检索模型的合成预训练

计算与语言 2021-04-19 v1 人工智能 信息检索

摘要

近期研究表明,常见的机器阅读理解(MRC)数据集可用于训练高性能的神经信息检索(IR)系统。然而,迄今为止神经IR的评估仅限于标准监督学习设置,在此类设置中它们已超越传统的词项匹配基线。我们对神经IR进行了域内与域外评估,并致力于提升其在不同场景(包括零样本设置)下的鲁棒性。我们表明,使用序列到序列生成器合成的训练样本可有效地服务于这一目标:在我们的实验中,使用合成样本进行预训练在五个不同测试集的域内与域外评估中均提升了检索性能。

关键词

引用

@article{arxiv.2104.07800,
  title  = {Towards Robust Neural Retrieval Models with Synthetic Pre-Training},
  author = {Revanth Gangi Reddy and Vikas Yadav and Md Arafat Sultan and Martin Franz and Vittorio Castelli and Heng Ji and Avirup Sil},
  journal= {arXiv preprint arXiv:2104.07800},
  year   = {2021}
}