再思考才能看见更多:医学视觉-语言模型中的迭代推理
计算机视觉与模式识别
2025-10-14 v1 人工智能
摘要
医学视觉-语言模型 (VLM) 在图像-文本理解方面表现出色,但通常依赖单次推理,忽略局部视觉线索。在临床实践中,人类专家会不断扫描、聚焦和细化感兴趣的区域,然后再作出最终诊断。为缩小机器与人类感知之间的差距,本文提出ViTAR框架,模拟人类专家的迭代推理过程,通过“思考-行动-再思考-回答”的认知链条实现。ViTAR将医学图像视为交互式对象,使模型能够进行多步骤视觉推理。为支持这一方法,我们策划了由1K个交互式示例构成的高质量指令数据集,编码了类似专家的诊断行为。此外,还构建了16K的视觉问答训练数据,以实现细粒度视觉诊断。我们提出两种训练策略:首先进行监督式微调以引导认知轨迹,其后采用强化学习优化决策。广泛的评估表明,ViTAR在性能上优于强大的现有最先进模型。视觉注意力分析揭示,从“思考”到“再思考”过程中,ViTAR越来越专注于临床关键区域,并在推理期间保持对视觉标记的高注意力分配,提供了其性能提升的机制性见解。这些发现表明,在VLM中嵌入类似专家的迭代思考链条,可提升医学 AI 的性能和可信度。
引用
@article{arxiv.2510.10052,
title = {Think Twice to See More: Iterative Visual Reasoning in Medical VLMs},
author = {Kaitao Chen and Shaohao Rui and Yankai Jiang and Jiamin Wu and Qihao Zheng and Chunfeng Song and Xiaosong Wang and Mu Zhou and Mianxin Liu},
journal= {arXiv preprint arXiv:2510.10052},
year = {2025}
}
备注
25 pages, 21 figures