论行为表征在稠密检索中的价值
信息检索
2022-08-12 v1
摘要
我们考虑在现实场景(如电商搜索)中于稠密表征空间内进行文本检索,其中(a)文档热度与(b)与某文档关联的查询多样性呈偏斜分布。当代多数稠密检索研究在此类场景下存在两点不足。(1)它们为每个文档学习几乎等量的表征,忽视了少数头部文档对取得良好检索性能具有不成比例的关键作用这一事实。(ii)它们学习纯粹由文档内在特征推断出的语义文档表征,这些表征可能不含足以判定文档相关查询的信息——尤其当文档较短时。我们提出通过用我们所提方法 MVG 学习的行为文档表征来增强双编码器学习的语义文档表征,以克服这些局限。为此,MVG(1)通过联系 Pitman-Yor 过程来确定如何在行为表征的总预算间分配,(2)简单地在基双编码器学习的表征空间内对给定文档相关查询(基于用户行为)聚类,并将簇中心作为其行为表征。我们的核心贡献在于发现:这样一种简单直观的轻量方法仅带来边际内存开销,却能在关键的一阶段检索指标上取得显著提升。我们通过在三个大型公开数据集上对比若干单向量与多向量双编码器、在一个专有电商搜索数据集上对比生产级双编码器,以及一项 A/B 测试,确立了上述结论。
引用
@article{arxiv.2208.05663,
title = {On the Value of Behavioral Representations for Dense Retrieval},
author = {Nan Jiang and Dhivya Eswaran and Choon Hui Teo and Yexiang Xue and Yesh Dattatreya and Sujay Sanghavi and Vishy Vishwanathan},
journal= {arXiv preprint arXiv:2208.05663},
year = {2022}
}