通过平衡主题感知采样高效训练有效的稠密检索器
信息检索
2021-05-27 v2 计算与语言
摘要
神经检索模型在训练、索引和查询工作流中具备资源效率,是其被广泛采用的关键一步。神经信息检索社区近期在训练有效的双编码器稠密检索(DR)模型方面取得了巨大进展。稠密文本检索模型对每个查询和段落使用单一向量表示来匹配打分,从而能够通过最近邻搜索实现低延迟的第一阶段检索。日益常见的训练方法需要巨大的计算能力,因为它们要么从持续更新刷新的索引中进行负段落采样,要么需要非常大的批量大小来进行批内负采样。我们不再依赖更强的计算能力,而是引入一种高效的主题感知查询与平衡间隔采样技术,称为 TAS-Balanced。我们在训练前对查询进行一次聚类,并从每个批次的一个簇中采样查询。我们使用一种结合成对与批内负采样教师的新型双教师监督来训练轻量级 6 层 DR 模型。我们的方法可在单块消费级 GPU 上于 48 小时内训练完成(而非常见的 8×V100 配置)。我们表明,我们的 TAS-Balanced 训练方法在两个 TREC 深度学习赛道查询集上取得了最先进的低延迟(每查询 64ms)结果。在 NDCG@10 上评估,我们比 BM25 高出 44%,比普通训练的 DR 高出 19%,比 docT5query 高出 11%,比先前最佳 DR 模型高出 5%。此外,TAS-Balanced 产出了首个在 TREC-DL 任意截断召回率上均优于其他所有方法的稠密检索器,并允许计算更密集的重排序模型在更少段落上运行以进一步提升结果。
引用
@article{arxiv.2104.06967,
title = {Efficiently Teaching an Effective Dense Retriever with Balanced Topic Aware Sampling},
author = {Sebastian Hofstätter and Sheng-Chieh Lin and Jheng-Hong Yang and Jimmy Lin and Allan Hanbury},
journal= {arXiv preprint arXiv:2104.06967},
year = {2021}
}
备注
Accepted at SIGIR 2021 (Full Paper track)