L^2R:基于向后兼容表示的首阶段检索终身学习
信息检索
2023-08-23 v1
摘要
首阶段检索是一项关键任务,旨在从大规模集合中检索相关文档候选。尽管现有检索模型已取得令人印象深刻的性能,但它们大多在静态数据集上研究,忽略了现实世界中 Web 上的数据持续增长且可能存在分布漂移。因此,在静态旧数据上训练的检索器可能不能很好地适应新到达的数据,并不可避免地产生次优结果。在这项工作中,我们研究首阶段检索的终身学习,特别关注新出现文档无标签的设置,因为相关性标注成本高昂且可能跟不上数据出现的速度。在此设置下,我们旨在开发模型更新,实现两个目标:(1) 利用无标签新到达数据有效适应演化的分布,(2) 避免每次模型更新时重新推断所有旧文档的嵌入以高效更新索引。我们首先形式化该任务,然后提出一种用于首阶段检索的 novel 终身学习方法是 L^2R。L^2R 采用典型的终身学习记忆机制,并包含两关键组件:(1) 为模型训练和记忆更新选择多样化支持负样本以实现有效模型适应,(2) 排序对齐目标以确保表示的向后兼容性,从而在不损害模型性能的情况下节省索引重建成本。为评估,我们从 LoTTE 和 Multi-CPR 数据集构建了两个新基准以模拟真实检索场景中的文档分布漂移。大量实验表明 L^2R 显著优于有竞争力的终身学习基线。
引用
@article{arxiv.2308.11512,
title = {L^2R: Lifelong Learning for First-stage Retrieval with Backward-Compatible Representations},
author = {Yinqiong Cai and Keping Bi and Yixing Fan and Jiafeng Guo and Wei Chen and Xueqi Cheng},
journal= {arXiv preprint arXiv:2308.11512},
year = {2023}
}
备注
accepted by CIKM2023