AgriEval:面向大型语言模型的综合中文农业基准
计算与语言
2025-07-30 v1
摘要
在农业领域,大型语言模型 (LLM) 的部署受限于缺乏训练数据和评估基准。为缓解此问题,我们提出 AgriEval,是第一个具有三个主要特征的全面中文农业基准:(1)全面的能力评估。AgriEval 涵盖农业的六大类和 29 个子类,涵盖四个核心认知场景:记忆、理解、推理和生成。(2)高质量数据。数据集来自大学水平的考试和作业,为评估 LLM 应用知识并做出专家式决策的能力提供了自然且稳健的基准。(3)多样化的格式和广泛的规模。AgriEval 包含 14,697 个多选题和 2,167 个开放式问答题,成为目前最广泛的农业基准。我们还在 51 个开源和商业 LLM 上进行了全面的实验。实验结果显示,大多数现有的 LLM 难以实现 60% 以上的准确率,这凸显了农业 LLM 的发展潜力。此外,我们进行了大量实验以探讨影响模型性能的因素并提出改进策略。AgriEval 可在 https://github.com/YanPioneer/AgriEval/ 获取。
引用
@article{arxiv.2507.21773,
title = {AgriEval: A Comprehensive Chinese Agricultural Benchmark for Large Language Models},
author = {Lian Yan and Haotian Wang and Chen Tang and Haifeng Liu and Tianyang Sun and Liangliang Liu and Yi Guan and Jingchi Jiang},
journal= {arXiv preprint arXiv:2507.21773},
year = {2025}
}
备注
36 pages, 22 figures