环境大语言模型评估(ELLE)数据集:评估生态与环境领域生成式AI应用的基准
计算与语言
2025-01-14 v1 信息检索
摘要
生成式AI在生态与环境应用中具有巨大潜力,如监测、数据分析、教育和政策支持。然而,其有效性受到缺乏统一评估框架的限制。为解决这一问题,我们提出了环境大语言模型评估(ELLE)问答(QA)数据集,这是第一个旨在评估大语言模型及其在生态与环境科学中应用的基准。ELLE数据集包含16个环境主题的1130个问答对,按领域、难度和类型分类。这个全面的数据集标准化了这些领域的性能评估,使得生成式AI性能的一致和客观比较成为可能。通过提供专门的评估工具,ELLE数据集促进了生成式AI技术在可持续环境成果方面的发展和应用。数据集和代码可在https://elle.ceeai.net/ 和 https://github.com/CEEAI/elle 获取。
引用
@article{arxiv.2501.06277,
title = {Environmental large language model Evaluation (ELLE) dataset: A Benchmark for Evaluating Generative AI applications in Eco-environment Domain},
author = {Jing Guo and Nan Li and Ming Xu},
journal= {arXiv preprint arXiv:2501.06277},
year = {2025}
}