你在 Token 什么?作为词表分布的稠密检索
计算与语言
2023-05-25 v2 信息检索
摘要
双编码器目前是稠密检索的主导架构。然而,我们对它们如何表示文本以及为何这能带来良好性能知之甚少。在本工作中,我们通过词表上的分布来阐明这一问题。我们提出通过将双编码器生成的向量表示投影到模型的词表空间来对其进行解释。我们表明,所得的投影包含丰富的语义信息,并揭示了它们与稀疏检索之间的联系。我们发现,这一视角可以为稠密检索器的某些失败案例提供解释。例如,我们观察到模型无法处理长尾实体,这与 token 分布倾向于遗忘这些实体的部分 token 相关。我们利用这一洞察,提出了一种在推理时用词汇信息丰富查询和段落表示的简单方法,并表明在零样本设置下,特别是在 BEIR 基准测试上,与原始模型相比这显著提升了性能。
引用
@article{arxiv.2212.10380,
title = {What Are You Token About? Dense Retrieval as Distributions Over the Vocabulary},
author = {Ori Ram and Liat Bezalel and Adi Zicher and Yonatan Belinkov and Jonathan Berant and Amir Globerson},
journal= {arXiv preprint arXiv:2212.10380},
year = {2023}
}
备注
ACL 2023