CRAB:用于评估生物医学中检索增强 LLM 策展能力的基准
计算与语言
2025-08-07 v2
摘要
检索增强大型语言模型 (LLM) 的最新进展在生物医学应用中展现出巨大前景。然而,在可靠地评估其策展能力——即模型选择和整合相关参考文献同时过滤噪声的过程——方面仍存在关键空白。为解决这一问题,我们引入了生物医学检索增强 LLM 策展基准 (CRAB),这是首个专为评估检索增强 LLM 在生物医学领域策展能力而量身定制的多语言基准,提供英语、法语、德语和中文版本。通过引入一种新颖的基于引用的评估指标,CRAB 量化了检索增强 LLM 在生物医学领域的策展性能。实验结果揭示了主流 LLM 在策展性能上的显著差异,凸显了在生物医学领域提高该能力的迫切需要。我们的数据集可在 https://huggingface.co/datasets/zhm0/CRAB 获取。
引用
@article{arxiv.2504.12342,
title = {CRAB: A Benchmark for Evaluating Curation of Retrieval-Augmented LLMs in Biomedicine},
author = {Hanmeng Zhong and Linqing Chen and Wentao Wu and Weilei Wang},
journal= {arXiv preprint arXiv:2504.12342},
year = {2025}
}