中文

ChatGPT-4、Gemini、Claude-3和Copilot在空间任务上的正确性比较

计算机与社会 2024-08-14 v4

摘要

生成式AI,包括大型语言模型,最近通过其多功能的任务解决能力(包括编程、算术推理、样本数据生成、时间序列预测、地名识别或图像分类)在地球科学界引起了极大兴趣。现有的大多数LLM在空间任务上的性能评估主要关注ChatGPT,而其他聊天机器人受到的关注较少。为了缩小这一研究差距,本研究对四个著名聊天机器人(即ChatGPT-4、Gemini、Claude-3和Copilot)在七个任务类别中的76个空间任务进行了零样本正确性评估。聊天机器人在与空间素养、GIS理论以及编程代码和函数解释相关的任务上通常表现良好,但在制图、代码编写和空间推理方面显示出弱点。此外,四个聊天机器人之间的结果正确性存在显著差异。每个聊天机器人重复任务的结果显示出高度的一致性,四个聊天机器人中大多数任务类别的匹配率超过80%。

关键词

引用

@article{arxiv.2401.02404,
  title  = {Correctness Comparison of ChatGPT-4, Gemini, Claude-3, and Copilot for Spatial Tasks},
  author = {Hartwig H. Hochmair and Levente Juhasz and Takoda Kemp},
  journal= {arXiv preprint arXiv:2401.02404},
  year   = {2024}
}

备注

Published in Transactions in GIS