中文

思维如植物学家:以意图驱动的链式询问挑战多模态语言模型

计算机视觉与模式识别 2026-04-24 v1 人工智能 计算与语言

摘要

视觉评估通常通过多步骤流程完成。在当代许多领域中,专家会通过结构化、基于证据的自适应提问来分析图像。在植物病理学中,植物学家会检查叶片图像,识别视觉线索,推断诊断意图,并针对种类、症状和严重程度进行有针对性的提问。这种结构化探测对于准确诊断和制定治疗方案至关重要。然而,当前的视觉语言模型是在单轮问答任务上进行评估的。为弥合这一差距,我们提出PlantInquiryVQA,一个用于研究植物学诊断中多步骤、意图驱动的视觉推理基准。我们将诊断轨迹建模为以基于视觉线索和明确意图为条件的有序问答序列。我们发布了一个包含24,950个专家精选植物图像和138,068个带有视觉 grounding、严重程度标签和领域特定推理模板的问答对数据集。在顶尖多模态大语言模型上的评估显示,虽然这些模型能够充分描述视觉症状,但在安全的临床推理和准确诊断方面仍存在挑战。重要的是,结构化的问答引导询问显著改善了诊断正确性,减少了幻觉,并提高了推理效率。我们希望PlantInquiryVQA成为推动研究训练具备类似专家植物学家推理能力的诊断代理的基石。

关键词

引用

@article{arxiv.2604.20983,
  title  = {Thinking Like a Botanist: Challenging Multimodal Language Models with Intent-Driven Chain-of-Inquiry},
  author = {Syed Nazmus Sakib and Nafiul Haque and Shahrear Bin Amin and Hasan Muhammad Abdullah and Md. Mehedi Hasan and Mohammad Zabed Hossain and Shifat E. Arman},
  journal= {arXiv preprint arXiv:2604.20983},
  year   = {2026}
}

备注

Accepted at ACL 2026 Findings