迈向无一致性过滤的无监督稠密检索学习
信息检索
2023-08-08 v1 计算与语言
机器学习
网络与互联网体系结构
摘要
领域迁移是现代神经信息检索(IR)中的普遍挑战。为克服该问题,先前研究利用领域特定的手动标注以及由一致性过滤生成的合成数据来微调通用排序器并产生领域特定排序器。然而,训练此类一致性过滤器计算开销大,显著降低了模型效率。此外,一致性过滤常难以识别目标领域中的检索意图并识别查询与语料分布。在本研究中,我们评估了一种更高效的方案:以直接伪标注、伪相关反馈或无监督关键词生成方法替代一致性过滤器,以实现一致的无过滤无监督稠密检索。我们广泛的实验评估表明,平均而言,基于TextRank的伪相关反馈优于其他方法。此外,我们分析了所提范式的训练与推理效率。结果表明,无过滤无监督学习能在保持检索性能的同时持续提升训练与推理效率。在某些情况下,其甚至能基于特定数据集提升性能。
引用
@article{arxiv.2308.02926,
title = {Towards Consistency Filtering-Free Unsupervised Learning for Dense Retrieval},
author = {Haoxiang Shi and Sumio Fujita and Tetsuya Sakai},
journal= {arXiv preprint arXiv:2308.02926},
year = {2023}
}