新鲜但陈旧的嵌入表示:通过纠错网络提升稠密检索器训练
机器学习
2024-09-04 v1
摘要
在稠密检索中,深度编码器为输入和目标提供嵌入表示,并使用 softmax 函数对大量候选目标(如信息检索中的文本段落)进行分布参数化。随着目标编码器模型计算成本高昂以及目标嵌入因目标编码器参数持续训练而陈旧化的背景,训练此类编码器面临诸多挑战。本文提出一种简单且高度可扩展的解决方案:训练一个小型参数化纠错网络,用于调整缓存的陈旧目标嵌入,从而实现精确的 softmax 近似,从而采样出最新且高分数的“硬负样本”。我们理论地研究了所提目标纠错器的泛化属性,阐明了网络复杂度、缓存表示的陈旧程度以及训练数据的量之间的关系。我们在大型基准稠密检索数据集以及带有检索增强语言模型的问答任务上进行了实验。我们的ethods 在训练期间仅进行一次初始缓存构建(基于无监督预训练模型),即可达到状态的最佳效果,计算成本降低 4-80 倍。
引用
@article{arxiv.2409.01890,
title = {A Fresh Take on Stale Embeddings: Improving Dense Retriever Training with Corrector Networks},
author = {Nicholas Monath and Will Grathwohl and Michael Boratko and Rob Fergus and Andrew McCallum and Manzil Zaheer},
journal= {arXiv preprint arXiv:2409.01890},
year = {2024}
}
备注
ICML 2024