中文

多模态大语言模型在农业图像理解与生成任务中的幻觉行为

计算机视觉与模式识别 2026-05-28 v1 人工智能

摘要

大型语言模型 (LLM) 正在农业成像应用中快速采用,涵盖从作物解读到合成田野图像生成等多个领域。然而,这些模型经常会产生表面自信却偏离生物或环境现实的幻觉输出,可能导致农业决策误导。本研究从两个互补方向系统性地探讨此类幻觉现象:图像到文本任务中,LLM 解读作物或田野图像以描述生物学或环境因素(如生物胁迫与非生物胁迫);文本到图像任务中,模型基于描述性提示生成合成农业场景。我们在多个成像模态下,依据领域知识标准评估生物学不一致、情境错误和农业不合理性等错误,分析了解释性与生成性任务中的常见幻觉模式。图像解释方面,LLM (如 Gemma、LLAVA、Qwen 和 MiniCPM) 实现的零样本准确率为 63%至 75%,而少量样本提示下提升至 86.8%,仍存在误检和漏检,表明残余幻觉效应。文本生成方面,GPT-5 和 Gemini 2.5 Flash 等高级模型在放宽提示约束下可生成最高达 91% 的生物学不一致场景,揭示当前 LLM 在此方面的根本局限。本系统性评估为提升基于 LLM 的农业成像平台的可靠性与可信度提供了关键洞见。

关键词

引用

@article{arxiv.2605.27595,
  title  = {Hallucination Behavior in Multimodal LLMs Across Agricultural Image Interpretation and Generation Tasks},
  author = {Partho Ghose and Al Bashir and Prem Raj and Azlan Zahid},
  journal= {arXiv preprint arXiv:2605.27595},
  year   = {2026}
}