评估基于地理空间代码生成的大语言模型
计算与语言
2024-12-16 v2 软件工程
摘要
软件开发支持工具长期以来一直是研究的重点,近期方法则使用大型语言模型(LLM)进行代码生成。这些模型可以为数据科学和机器学习应用生成 Python 代码。对于软件工程师来说,LLM 有助于提高日常工作效率。LLM 还可作为不熟悉的软件开发者的“导师”,成为可行的学习支持工具。在地理空间数据科学中,高质量的代码生成也具有重要意义。然而,该领域提出了不同挑战,代码生成 LLM 通常不会在地理空间任务上进行评估。本文展示了我们如何构建基于地理空间任务的评估基准。我们依据任务的复杂性和所需工具对地理空间任务进行分类。随后,我们创建了一个包含空间推理、空间数据处理和地理空间工具使用能力测试的任务数据集。该数据集由为高质量而手动创建的具体编码问题组成。对于每个问题,我们提出了一组测试方案,使自动检查生成代码的正确性成为可能。此外,我们测试了现有代码生成 LLM 在地理空间领域的代码生成能力。我们在公开的 GitHub 存储库中共享数据集和可复现的评估代码,认为这可以作为未来新 LLM 的评估基准。我们的数据集希望能够促进开发出能够高精度解决地理空间编码任务的新模型。这些模型将使针对地理空间应用的编码助手得以创建。
引用
@article{arxiv.2410.04617,
title = {Evaluation of Code LLMs on Geospatial Code Generation},
author = {Piotr Gramacki and Bruno Martins and Piotr Szymański},
journal= {arXiv preprint arXiv:2410.04617},
year = {2024}
}
备注
7th ACM SIGSPATIAL International Workshop on AI for Geographic Knowledge Discovery (GeoAI'24)