中文

HawkBench:探究 RAG 方法在分层信息搜寻任务上的韧性

信息检索 2025-09-25 v2 人工智能 计算与语言

摘要

在真实世界的信息搜寻场景中,用户具有动态且多样的需求,要求 RAG 系统展现出适应性韧性。为全面评估当前 RAG 方法的韧性,我们引入了 HawkBench,这是一个由人工标注的多领域基准,旨在严格评估 RAG 在分类任务类型上的性能。通过基于信息搜寻行为对任务进行分层,HawkBench 系统地评估了 RAG 系统适应多样用户需求的能力。与主要关注特定任务类型(多为事实性查询)并依赖不同知识库的现有基准不同,HawkBench 提供:(1) 系统的任务分层,涵盖广泛的查询类型,包括事实性查询和原理性查询;(2) 在所有任务类型中整合多领域语料库以减轻语料库偏差;(3) 严格的标注以确保高质量评估。HawkBench 包含 1,600 个高质量测试样本,均匀分布在各领域和任务类型中。使用该基准,我们评估了具有代表性的 RAG 方法,从答案质量和响应延迟方面分析了其性能。我们的发现强调,需要整合决策、查询解释和全局知识理解的动态任务策略来提高 RAG 的泛化能力。我们相信 HawkBench 可作为推进 RAG 方法韧性及其实现通用信息搜寻能力的关键基准。

关键词

引用

@article{arxiv.2502.13465,
  title  = {HawkBench: Investigating Resilience of RAG Methods on Stratified Information-Seeking Tasks},
  author = {Hongjin Qian and Zheng Liu and Chao Gao and Yankai Wang and Defu Lian and Zhicheng Dou},
  journal= {arXiv preprint arXiv:2502.13465},
  year   = {2025}
}

备注

Neurips 25 DB Track, Spotlight