中文

AutoGEEval:面向Google Earth Engine上基于大语言模型的地理空间代码生成的多模态自动化评估框架

软件工程 2025-05-20 v1 人工智能 计算几何 计算与语言 数据库

摘要

地理空间代码生成正成为人工智能与地球科学分析集成的关键方向,但目前缺乏针对该领域的自动化评估标准化工具。为填补这一空白,本文提出AutoGEEval——首个面向Google Earth Engine(GEE)平台上基于大语言模型(LLMs)的多模态、单元级自动化评估框架。该框架基于GEE Python API构建,建立包含1325个测试用例的基准套件(AutoGEEval-Bench),涵盖26种GEE数据类型。框架集成了问题生成与答案验证组件,实现从函数调用到执行验证的端到端自动化评估流程。AutoGEEval支持对模型输出在准确性、资源消耗、执行效率和错误类型等方面的多维度定量分析。我们评估了18个最先进的LLMs——包括通用型、推理增强型、代码导向型和地球科学专用型模型,揭示其在GEE代码生成中的性能特征及潜在优化路径。本工作提供了统一的协议和基础资源,为地理空间代码生成模型的开发与评估提供支持,推动了自然语言向领域特定代码翻译的自动化前沿。

关键词

引用

@article{arxiv.2505.12900,
  title  = {AutoGEEval: A Multimodal and Automated Framework for Geospatial Code Generation on GEE with Large Language Models},
  author = {Shuyang Hou and Zhangxiao Shen and Huayi Wu and Jianyuan Liang and Haoyue Jiao and Yaxian Qing and Xiaopu Zhang and Xu Li and Zhipeng Gui and Xuefeng Guan and Longgang Xiang},
  journal= {arXiv preprint arXiv:2505.12900},
  year   = {2025}
}