面向稠密检索的域匹配预训练任务
计算与语言
2021-07-30 v1 信息检索
摘要
在更大的数据集上以不断增大的模型规模进行预训练,如今已被证明是提升几乎所有NLP任务性能的有效方法。一个显著的例外是信息检索,迄今为止额外的预训练未能产生令人信服的结果。我们表明,通过恰当的预训练设置,这一障碍可以被克服。我们通过在一个近期发布的6500万条合成生成问题集,以及由pushshift.io提供的既有Reddit对话数据集中的2亿对帖子-评论对上预训练大型双编码器模型来证实这一点。我们在一组信息检索和对话检索基准上进行了评估,显示出相对于有监督基线的实质性改进。
引用
@article{arxiv.2107.13602,
title = {Domain-matched Pre-training Tasks for Dense Retrieval},
author = {Barlas Oğuz and Kushal Lakhotia and Anchit Gupta and Patrick Lewis and Vladimir Karpukhin and Aleksandra Piktus and Xilun Chen and Sebastian Riedel and Wen-tau Yih and Sonal Gupta and Yashar Mehdad},
journal= {arXiv preprint arXiv:2107.13602},
year = {2021}
}