面向多维度稠密检索器与维度学习的可复现性分析与增强
信息检索
2024-01-17 v2
摘要
多维度稠密检索旨在将维度信息(例如品牌和类别)融入双编码器,以促进相关性匹配。作为早期且具有代表性的多维度稠密检索器,MADRAL学习若干额外的维度嵌入,并将显式维度与一个隐式维度“OTHER”融合以得到最终表示。MADRAL在专有数据上进行了评估,且其代码未公开,这使得在其他数据集上验证其有效性颇具挑战。我们未能在公开的MA-Amazon数据上复现其有效性,这促使我们探究原因并重新审视其组件。我们提出了若干组件替代方案进行比较,包括用“CLS”替换“OTHER”,以及用前几个内容词元表示维度。通过大量实验,我们证实了在维度融合中从头学习“OTHER”是有害的。相比之下,我们提出的变体可以大幅提升检索性能。我们的研究不仅揭示了MADRAL的局限性,也为未来研究更强大的多维度稠密检索模型提供了宝贵见解。代码将发布于:https://github.com/sunxiaojie99/Reproducibility-for-MADRAL。
引用
@article{arxiv.2401.03648,
title = {Reproducibility Analysis and Enhancements for Multi-Aspect Dense Retriever with Aspect Learning},
author = {Keping Bi and Xiaojie Sun and Jiafeng Guo and Xueqi Cheng},
journal= {arXiv preprint arXiv:2401.03648},
year = {2024}
}
备注
accepted by ecir2024 as a reproducibility paper