中文

ARHN:基于开源 LLM 的基于答案导向的硬负样本重新标注用于密集检索

信息检索 2026-04-14 v1

摘要

神经检索器通常在大规模三元组数据上进行训练,包含查询、正 passages 以及一组硬负样本。实际情况下,硬负样本挖掘可能引入虚假负样本和其他模糊负样本,包括与查询相关或包含查询部分答案的 passages。此类标签噪声导致监督信号不一致,可能降低检索效果。我们提出ARHN(Answer-centric Relabeling of Hard Negatives),一个两阶段框架,利用开源 LLM 基于答案导向相关性信号细化硬负样本。在第一阶段,ARHN 为每个查询-passage 对生成基于 passage 的答案片段或指示 passage 不支持答案。在第二阶段,ARHN 对候选集合应用基于 LLM 的列表排序,按直接可回答性对查询进行排序。排在正样本之前的 passages 被重新标注为额外正样本。在正样本之后的 passages 中,ARHN 排除包含答案片段的样本,以避免模糊监督。我们在BEIR基准上评估了ARHN,采用三种配置:仅重新标注、仅过滤、两者结合。跨数据集,组合策略始终优于单独使用其中一项,表明联合重新标注虚假负样本和过滤模糊负样本可为训练神经检索模型提供更干净的监督。通过严格依赖开源模型,ARHN构建了一个成本低且可扩展的细化管道,适用于大规模训练。

关键词

引用

@article{arxiv.2604.11092,
  title  = {ARHN: Answer-Centric Relabeling of Hard Negatives with Open-Source LLMs for Dense Retrieval},
  author = {Hyewon Choi and Jooyoung Choi and Hansol Jang and Hyun Kim and Chulmin Yun and ChangWook Jun and Stanley Jungkyu Choi},
  journal= {arXiv preprint arXiv:2604.11092},
  year   = {2026}
}

备注

Accepted to SIGIR 2026