各向同性表示可改进稠密检索
计算与语言
2023-08-01 v2
摘要
近期语言表示建模的进展广泛影响了稠密检索模型的设计。特别是,许多高性能稠密检索模型使用 BERT 评估查询与文档的表示,并随后应用基于余弦相似度的打分来确定相关性。然而,已知 BERT 表示遵循窄锥形的各向异性分布,而这种各向异性分布对于基于余弦相似度的打分是不利的。本工作中,我们首先表明基于 BERT 的 DR(稠密检索)同样遵循各向异性分布。为应对该问题,我们引入了 Normalizing Flow 与白化两种无监督后处理方法,并除序列级方法外还发展了词元级方法,以将这些后处理方法应用于稠密检索模型的表示。我们表明所提方法能有效增强表示使之各向同性,随后使用 ColBERT 与 RepBERT 进行实验,表明文档重排序性能(NDCG at 10)对于 ColBERT 可提升 5.17\%8.09\%,对于 RepBERT 可提升 6.88\%22.81\%。为检验各向同性表示提升 DR 模型鲁棒性的潜力,我们考察了测试集异于训练集的分布外任务。结果显示各向同性表示能取得总体改进的性能。例如,当训练集为 MS-MARCO、测试集为 Robust04 时,各向同性后处理可将基线性能提升至多 24.98\%。此外,我们表明使用分布外数据集训练的各向同性模型甚至可优于使用分布内数据集训练的基线模型。
引用
@article{arxiv.2209.00218,
title = {Isotropic Representation Can Improve Dense Retrieval},
author = {Euna Jung and Jungwon Park and Jaekeol Choi and Sungyoon Kim and Wonjong Rhee},
journal= {arXiv preprint arXiv:2209.00218},
year = {2023}
}
备注
9 pages, 4 figures