中文

面向稠密文本检索的近似最近邻负对比学习

信息检索 2020-10-22 v2 计算与语言 机器学习

摘要

在稠密学习表示空间中进行文本检索相比稀疏检索具有许多引人注目的优势。然而稠密检索(DR)的有效性常常需要与稀疏检索结合。在本文中,我们指出主要瓶颈在于训练机制,即训练中使用的负实例不能代表测试中的不相关文档。本文提出近似最近邻负对比估计(ANCE),一种从语料的近似最近邻(ANN)索引中构造负例的训练机制,该索引随学习过程并行更新以选择更真实的负训练实例。这从根本上解决了 DR 训练和测试所用数据分布的不一致问题。在我们的实验中,ANCE 将 BERT-Siamese DR 模型提升至优于所有有竞争力的稠密与稀疏检索基线。它在 ANCE 学习的表示空间中使用点积几乎匹配了稀疏检索加 BERT 重排序的准确率,并提供了近 100 倍的加速。

关键词

引用

@article{arxiv.2007.00808,
  title  = {Approximate Nearest Neighbor Negative Contrastive Learning for Dense Text Retrieval},
  author = {Lee Xiong and Chenyan Xiong and Ye Li and Kwok-Fung Tang and Jialin Liu and Paul Bennett and Junaid Ahmed and Arnold Overwijk},
  journal= {arXiv preprint arXiv:2007.00808},
  year   = {2020}
}