BRIGHT:面向推理密集型检索的真实且具挑战性基准
计算与语言
2025-03-27 v4 人工智能
信息检索
摘要
现有检索基准主要由信息寻求查询组成(例如来自搜索引擎的聚合问题),其中关键词或语义-based 检索通常足够。然而,许多复杂的真实查询需要深入的推理才能识别相关文档,超越表面形式匹配。例如,寻找编码问题的文档需要理解涉及的函数的逻辑和语法。为更好地对此类具有挑战性的查询进行检索基准测试,我们引入 BRIGHT,这是第一个需要进行密集推理才能检索相关文档的文本检索基准。我们的数据集包含 1,384 个真实世界查询,涵盖经济学、心理学、数学和编程等多个领域。这些查询来自自然发生且经过精心挑选的人类数据。广泛的评估显示,甚至最先进的检索模型在 BRIGHT 上也表现不佳。位于 MTEB 排行榜领先位置的模型(Muennighoff 等,2023)SFR-Embedding-Mistral(Meng 等,2024),在 BRIGHT 上仅获得 18.3 的 nDCG@10 分数,而在 MTEB 上得分 59.0。我们表明, incorporating 对查询进行显式推理可提高检索性能,提升最高可达 12.2 分。此外,融合顶尖检索器检索到的文档可提升问答性能。我们认为 BRIGHT 为未来在更真实和更具挑战性的环境中开发检索系统铺平了道路。
引用
@article{arxiv.2407.12883,
title = {BRIGHT: A Realistic and Challenging Benchmark for Reasoning-Intensive Retrieval},
author = {Hongjin Su and Howard Yen and Mengzhou Xia and Weijia Shi and Niklas Muennighoff and Han-yu Wang and Haisu Liu and Quan Shi and Zachary S. Siegel and Michael Tang and Ruoxi Sun and Jinsung Yoon and Sercan O. Arik and Danqi Chen and Tao Yu},
journal= {arXiv preprint arXiv:2407.12883},
year = {2025}
}
备注
51 pages