EnviroExam:大语言模型环境科学知识的基准测试
计算与语言
2024-05-21 v1 人工智能
摘要
在环境科学领域,拥有稳健的大语言模型评估指标以确保其有效性和准确性至关重要。我们提出了EnviroExam,一种旨在评估大语言模型在环境科学领域知识的综合评估方法。EnviroExam基于国际顶尖大学的课程,涵盖本科、硕士和博士课程,包括42门核心课程的936个问题。通过对31个开源大语言模型进行0-shot和5-shot测试,EnviroExam揭示了这些模型在环境科学领域的性能差异,并提供了详细的评估标准。结果显示,61.3%的模型通过了5-shot测试,而48.39%通过了0-shot测试。通过引入变异系数作为指标,我们从多个角度评估了主流开源大语言模型在环境科学中的表现,为该领域选择和微调语言模型提供了有效标准。未来的研究将涉及使用专门的环境科学教科书构建更多领域特定的测试集,以进一步提高评估的准确性和特异性。
引用
@article{arxiv.2405.11265,
title = {EnviroExam: Benchmarking Environmental Science Knowledge of Large Language Models},
author = {Yu Huang and Liang Guo and Wanqian Guo and Zhe Tao and Yang Lv and Zhihao Sun and Dongfang Zhao},
journal= {arXiv preprint arXiv:2405.11265},
year = {2024}
}