中文

MURR:基于正则回放的数据流模型更新策略

信息检索 2025-04-15 v1 计算与语言

摘要

互联网产生持续的新文档流和用户生成查询,这些内容会随世界事件和语言演变而变化。训练于固定查询-文档对的神经检索模型会迅速失效,无法准确代表新创建的内容和查询,导致检索效果下降。传统统计稀疏检索可更新集合统计以反映文档和查询语言使用的变化。相比之下,对基于 DPR 和 ColBERT 等神经检索方法底层语言模型的持续微调会导致与Previously 编码文档不兼容。重新编码和重新索引所有先前处理的文档代价高昂。本文探讨了一种无需重新处理历史文档的神经双编码器检索模型更新方法。我们提出了 MURR(Model Updating with Regularized Replay)策略,以确保模型能够在不重新处理历史文档的前提下,仍能准确检索现有文档,同时继续针对最新主题进行模型更新。在模拟的流式环境中,我们表明使用 MURR 进行模型微调,相较于其他策略,能够在文档和查询流逝过程中实现更有效且更一致的检索结果。

关键词

引用

@article{arxiv.2504.10250,
  title  = {MURR: Model Updating with Regularized Replay for Searching a Document Stream},
  author = {Eugene Yang and Nicola Tonellotto and Dawn Lawrie and Sean MacAvaney and James Mayfield and Douglas W. Oard and Scott Miller},
  journal= {arXiv preprint arXiv:2504.10250},
  year   = {2025}
}

备注

Published at ECIR 2025. 16 pages, 4 figures