BAGEL:语言模型动物知识专精基准
计算与语言
2026-04-20 v1 人工智能
摘要
大语言模型在广泛领域的知识和推理基准上表现出强大的性能,但语言模型在统一的闭卷评估协议下处理专业动物相关知识的能力仍不明朗。我们引入 BAGEL,一个用于评估语言模型动物知识专精的基准。BAGEL 由多样化的科学和参考来源构建而成,包括 bioRxiv、Global Biotic Interactions、Xeno-canto 和 Wikipedia,采用精选示例和自动生成的闭卷问答对的结合方式。该基准涵盖动物知识的多个方面,包括分类学、形态学、栖息地、行为、鸣叫、地理分布和种间相互作用。通过聚焦闭卷评估,BAGEL 在推理时不使用外部检索,测量模型的动物相关知识。BAGEL 进一步支持跨源域、分类学群和知识类别的细粒度分析,使我们能够更精确地刻画模型的优势和系统性失效模式。我们的基准为研究语言模型在领域特定知识泛化提供了新的测试平台,并有助于提高其在生物多样性相关应用中的可靠性。
引用
@article{arxiv.2604.16241,
title = {BAGEL: Benchmarking Animal Knowledge Expertise in Language Models},
author = {Jiacheng Shen and Masato Hagiwara and Milad Alizadeh and Ellen Gilsenan-McMahon and Marius Miron and David Robinson and Emmanuel Chemla and Sara Keen and Gagan Narula and Mathieu Laurière and Matthieu Geist and Olivier Pietquin},
journal= {arXiv preprint arXiv:2604.16241},
year = {2026}
}
备注
28 pages, 3 figures