中文

在零样本情境下,智能体能否区分视觉上难以分离的疾病?一项试验性研究

计算机视觉与模式识别 2026-02-27 v1

摘要

多模态大语言模型(MLLM)的快速发展导致对智能体系统日益关注的趋势。虽然大多数医学影像研究聚焦于自动化常规临床工作流程,但我们研究了一个较少探索却临床意义重大的情境:在零样本情境下区分视觉上难以分离的疾病。我们对代表性智能体在两种影像唯一的代理诊断任务上进行基准测试:(1)黑色素瘤与异常色素瘤的鉴别;(2)肺水肿与肺炎的鉴别,其中视觉特征高度混淆,尽管临床管理存在显著差异。我们引入基于对比裁决的多智能体框架。实验结果显示,在皮肤镜数据上诊断准确率提升了11个百分点,同时对定性样本的不支持性声称显著减少,尽管整体性能仍不足以实现临床部署。我们认识到人工标注固有的不确定性以及缺乏临床背景的事实,这进一步限制了向现实场景的转化。就受控情境而言,这一试验性研究为零样本智能体在视觉混淆情境下的表现提供了初步见解。

关键词

引用

@article{arxiv.2602.22959,
  title  = {Can Agents Distinguish Visually Hard-to-Separate Diseases in a Zero-Shot Setting? A Pilot Study},
  author = {Zihao Zhao and Frederik Hauke and Juliana De Castilhos and Sven Nebelung and Daniel Truhn},
  journal= {arXiv preprint arXiv:2602.22959},
  year   = {2026}
}

备注

Code available at https://github.com/TruhnLab/Contrastive-Agent-Reasoning