IFIR:用于专家领域信息检索中指令遵循的综合基准
计算与语言
2025-03-07 v1 信息检索
摘要
我们介绍IFIR,是首个综合性基准,旨在评估专家领域信息检索(IR)中的指令遵循能力。IFIR包含2,426个高质量示例,覆盖八个子集,涉及金融、法律、医疗和科学文献四个专业领域。每个子集针对一个或多个领域特定检索任务,复制了指令在实际场景中至关重要的情形。IFIR通过纳入不同层次复杂度的指令,实现对指令遵循检索能力的详细分析。我们还提出了一种新颖的基于大语言模型(LLM)的评估方法,以提供更精确可靠的模型性能评估。通过在15个前沿检索模型上的大量实验,包括基于LLM的模型,我们的结果揭示了当前模型在有效遵循复杂、领域特定指令方面面临重大挑战。我们进一步提供深入分析,凸显这些局限性,为指引未来在检索器开发方面的进步提供了宝贵洞见。
引用
@article{arxiv.2503.04644,
title = {IFIR: A Comprehensive Benchmark for Evaluating Instruction-Following in Expert-Domain Information Retrieval},
author = {Tingyu Song and Guo Gan and Mingsheng Shang and Yilun Zhao},
journal= {arXiv preprint arXiv:2503.04644},
year = {2025}
}
备注
NAACL 2025 Main