中文

GPT-4 作为评估器:评估大语言模型在农业害虫管理中的表现

计算与语言 2024-03-19 v1

摘要

在快速发展的人工智能 (AI) 领域,大语言模型 (LLM) 在农业特别是害虫管理中的应用仍处于起步阶段。我们旨在通过评估 LLM 生成的害虫管理建议内容来证明其可行性,包括 OpenAI 的生成式预训练 Transformer (GPT) 系列和 Google 的 FLAN 系列。考虑到农业建议的上下文特定性,自动测量或量化 LLM 生成文本的质量成为一个重大挑战。我们提出了一种创新方法,使用 GPT-4 作为评估器,对生成内容在连贯性、逻辑一致性、流畅性、相关性、可理解性和穷尽性方面进行评分。此外,我们集成了一个基于作物阈值数据的专家系统作为基线,以获取关于农田中发现的害虫是否应采取管理行动的事实准确性得分。每个模型的得分按百分比加权以获得最终得分。结果表明,GPT-3.4 和 GPT-4 在大多数评估类别中优于 FLAN 模型。此外,使用包含领域特定知识的基于指令的提示证明了 LLM 作为农业中有效工具的可行性,准确率达到 72%,证明了 LLM 在提供害虫管理建议方面的有效性。

关键词

引用

@article{arxiv.2403.11858,
  title  = {GPT-4 as Evaluator: Evaluating Large Language Models on Pest Management in Agriculture},
  author = {Shanglong Yang and Zhipeng Yuan and Shunbao Li and Ruoling Peng and Kang Liu and Po Yang},
  journal= {arXiv preprint arXiv:2403.11858},
  year   = {2024}
}