SciRerankBench:面向科学检索增强生成大语言模型的重排序基准评测
计算与语言
2025-09-25 v2 人工智能
摘要
科学文献问答是迈向新科学发现的关键一步。近年来,两阶段检索增强生成大语言模型(RAG-LLMs)在这一领域展现出令人瞩目的进展。这种两阶段框架,尤其是第二阶段(重排序器),在科学领域尤为关键,因为术语的细微差异可能对最终的事实导向或知识密集型答案产生极大的负面影响。尽管取得了这些显著进展,但这些工作的潜力和局限性仍未得到充分探索。本文提出了一个面向科学重排序的 RAG 基准(SciRerankBench),用于评估 RAG-LLMs 系统中的重排序器,涵盖五个科学学科。为了严格评估重排序器在噪声鲁棒性、相关性消歧和事实一致性方面的性能,我们构建了三种类型的问题-上下文-答案(Q-C-A)对,即噪声上下文(NC)、语义相似但逻辑无关上下文(SSLI)和反事实上下文(CC)。通过在五个系列的 LLMs 上对 13 个广泛使用的重排序器进行系统评估,我们详细揭示了它们的相对优势与局限性。据我们所知,SciRerankBench 是首个专门为评估 RAG-LLMs 中的重排序器而开发的基准,为其未来发展提供了宝贵的观察与指导。
引用
@article{arxiv.2508.08742,
title = {SciRerankBench: Benchmarking Rerankers Towards Scientific Retrieval-Augmented Generated LLMs},
author = {Haotian Chen and Qingqing Long and Meng Xiao and Xiao Luo and Wei Ju and Chengrui Wang and Xuezhi Wang and Yuanchun Zhou and Hengshu Zhu},
journal= {arXiv preprint arXiv:2508.08742},
year = {2025}
}