中文

更好的眼睛,更好的思考:为何在医学中视觉链式思考失败

计算机视觉与模式识别 2026-04-13 v2 人工智能

摘要

大型视觉语言模型(VLMs)在一般领域常受益于链式思考(CoT)提示,但其在医学视觉语言任务中的效果尚未得到充分探讨。我们报告了一个反直觉趋势:在医学视觉问答任务中,CoT 在通用模型和医学特定模型中常常低于直接回答(DirA)。我们将其归因于一种“医学感知瓶颈”:细微的、领域特定的线索可能削弱视觉 grounding,CoT 可能而非纠正早期的感知不确定性。为探测此假设,我们引入两种训练-free、推理时的 grounding 干预措施:(i)通过目标区域线索实现感知锚定;(ii)通过高质量文本指导实现描述 grounding。在多个基准和模型家族上,这些干预措施提高了准确率,缓解了 CoT 降级,在几种情况下反转了 CoT--DirA 的逆转。我们的发现表明,可靠的临床 VLMs 需要稳健的视觉 grounding 和跨模态对齐,超越单纯延伸文本驱动的推理链。代码可在此处获取。

关键词

引用

@article{arxiv.2603.06665,
  title  = {Better Eyes, Better Thoughts: Why Vision Chain-of-Thought Fails in Medicine},
  author = {Yuan Wu and Zongxian Yang and Jiayu Qian and Songpan Gao and Guanxing Chen and Qiankun Li and Yu-An Huang and Zhi-An Huang},
  journal= {arXiv preprint arXiv:2603.06665},
  year   = {2026}
}