中文

关联性不等于相似性:为多跳检索学习语料库特定关联

信息检索 2026-04-24 v1 人工智能 计算与语言

摘要

密集检索系统通过查询嵌入相似度对段落进行排序,但多跳问题需要通过共享推理链与段落建立关联关系。我们引入关联增强检索(Association-Augmented Retrieval, AAR),这是一种轻量的转导式重排序方法,通过对共现标注进行对比学习,在嵌入空间中学习段落之间的关联关系。AAR采用一个小型多层感知机(4.2M参数)来学习关联关系。在推理阶段,AAR利用双向关联评分对初始密集检索候选集进行重排序。在HotpotQA上,AAR将段落Recall@5从0.831提升至0.916(提升8.6分),且无需在评估集上调参,提升主要集中在那些密集基线方法难以解决的难题上(提升28.5分)。在MuSiQue上,AAR在转导设置下实现了+10.1分的提升。一个在训练分割的关联上进行转导训练、在未见验证关联上评估的模型未显示出显著改进,这表明该方法捕获的是语料库特定的共现关系,而非可迁移的模式。消融研究支持这一解释:在语义相似但无关联的段落对上训练会导致检索性能低于基线,而随机化关联对会造成严重退化。下游QA评估显示,检索性能提升带来了+6.4的exact match提升。该方法每个查询仅增加3.7ms,训练时间在单个GPU上不足两分钟,且无需基于LLM的索引。

关键词

引用

@article{arxiv.2604.20850,
  title  = {Association Is Not Similarity: Learning Corpus-Specific Associations for Multi-Hop Retrieval},
  author = {Jason Dury},
  journal= {arXiv preprint arXiv:2604.20850},
  year   = {2026}
}

备注

10 pages, 7 appendices, 10 tables. Code: https://github.com/EridosAI/AAR