中文

BERM:训练均衡且可提取的匹配表示以提升稠密检索的泛化能力

信息检索 2023-05-19 v1 计算与语言

摘要

稠密检索在域内标注数据集上训练时,于第一阶段检索过程中已展现出潜力。然而,先前研究发现稠密检索难以泛化至未见领域,因其对域不变且可解释特征(即两文本间匹配信号,此为信息检索之本质)建模较弱。本文中,我们提出一种通过捕获匹配信号来提升稠密检索泛化的新方法,称为 BERM。完全细粒度表达与查询导向显著性是匹配信号的两个属性。因此,在 BERM 中,单篇段落被切分为多个单元,并提出两项单元级要求作为训练约束以获得有效匹配信号。其一为语义单元均衡,其二为本质匹配单元可提取性。单元级视角与均衡语义使表示以细粒度方式表达文本。本质匹配单元可提取性使段落表示对给定查询敏感,从而从含复杂上下文的段落中提取纯匹配信息。在 BEIR 上的实验表明,我们的方法可有效结合不同稠密检索训练方法(原生、难负样本挖掘与知识蒸馏)以提升其泛化能力,且无任何额外推理开销与目标域数据。

关键词

引用

@article{arxiv.2305.11052,
  title  = {BERM: Training the Balanced and Extractable Representation for Matching to Improve Generalization Ability of Dense Retrieval},
  author = {Shicheng Xu and Liang Pang and Huawei Shen and Xueqi Cheng},
  journal= {arXiv preprint arXiv:2305.11052},
  year   = {2023}
}

备注

Accepted by ACL 2023 Main