迈向更佳的指令遵循检索模型
计算与语言
2025-05-28 v1 信息检索
摘要
现代信息检索(IR)模型仅在标准<query, passage>对上训练,难以有效解释和遵循显式的用户指令。我们引入了InF-IR,一个专为增强指令遵循IR中的检索模型而定制的大规模、高质量训练语料库。InF-IR将传统训练对扩展为超过38,000个富有表现力的<instruction, query, passage>三元组作为正样本。特别地,对于每个正样本三元组,我们通过对指令和查询进行投毒生成两个额外的困难负样本,然后由先进的推理模型(o3-mini)严格验证,以确保语义合理性的同时保持指令上的不正确性。与主要支持仅解码器语言模型计算密集型重排序任务的现有语料库不同,InF-IR中高度对比性的正负样本三元组进一步使较小的仅编码器模型能够进行高效的表示学习,促进直接的基于嵌入的检索。使用该语料库,我们训练了InF-Embed,一种通过对比学习和指令-查询注意力机制优化的指令感知Embedding模型,以将检索结果与用户意图精确对齐。在五个基于指令的检索基准上的广泛实验表明,InF-Embed在衡量指令遵循能力的p-MRR指标上以8.1%的幅度显著超越了具有竞争力的基线。
关键词
引用
@article{arxiv.2505.21439,
title = {Towards Better Instruction Following Retrieval Models},
author = {Yuchen Zhuang and Aaron Trinh and Rushi Qiang and Haotian Sun and Chao Zhang and Hanjun Dai and Bo Dai},
journal= {arXiv preprint arXiv:2505.21439},
year = {2025}
}
备注
Retrieval Models, Embedding, Retrieval with Instructions