中文

LoL:一种面向伪相关反馈中查询重构损失的比较式正则化损失

信息检索 2022-04-26 v1 计算与语言 机器学习

摘要

伪相关反馈(PRF)已被证明是一种有效的查询重构技术,可提升检索准确率。其旨在缓解查询与潜在相关文档间语言表达的不匹配。现有PRF方法独立对待源自同一查询但使用不同数量反馈文档的修订查询,导致严重的查询漂移。若不比较同一查询的两种不同修订效果,PRF模型可能错误地关注更多反馈中增加的无关信息,从而重构出比使用较少反馈的修订更无效的查询。理想情况下,若PRF模型能区分反馈中的无关与相关信息,则反馈文档越多,修订查询越好。为弥补此差距,我们提出Loss-over-Loss(LoL)框架,在训练时比较同一查询不同修订间的重构损失。具体地,我们使用不同数量的反馈并行多次修订原始查询,并计算其重构损失。随后,我们对这些重构损失引入额外的正则化损失,以惩罚使用更多反馈却获得更大损失的修订。借助此种比较式正则化,PRF模型有望通过比对不同修订查询的效果来学习抑制额外增加的无关信息。进一步,我们提出一种可微查询重构方法以实现该框架。该方法在向量空间中修订查询并直接优化查询向量的检索性能,适用于稀疏与稠密检索模型。实证评估证明了我们的方法对两类典型稀疏与稠密检索模型的有效性与鲁棒性。

关键词

引用

@article{arxiv.2204.11545,
  title  = {LoL: A Comparative Regularization Loss over Query Reformulation Losses for Pseudo-Relevance Feedback},
  author = {Yunchang Zhu and Liang Pang and Yanyan Lan and Huawei Shen and Xueqi Cheng},
  journal= {arXiv preprint arXiv:2204.11545},
  year   = {2022}
}

备注

Accepted at SIGIR 2022