面向医学视觉语言模型的临床感知视觉链式推理
计算机视觉与模式识别
2026-03-03 v1 人工智能
摘要
医学视觉语言模型在临床决策支持方面展现出巨大的潜力,但由于缺乏对局部病理证据的充分 grounding,仍容易出现事实性幻觉。现有医学对齐方法主要在响应层面通过偏好优化实现,虽能提高输出正确性,但仍使中间推理与视觉区域的关联性较弱。虽然链式推理(Chain-of-Thought, CoT)可增强多模态推理,但仍偏向文本,限制了有效整合临床视觉线索。为此,我们提出ClinCoT框架,构建临床感知的视觉链式推理体系,将偏好优化从响应层面的纠正转化为视觉驱动的推理。我们引入自动数据生成管道,通过基于假设驱动的区域提案进行推理,构建临床 grounding 的偏好对。多个医学大语言模型评估器对每个响应进行排序并赋予分数,这些排序结果作为监督信号用于训练目标模型。我们进一步引入基于评分的边际感知优化策略,融合偏好排序与分数差异,对区域层面的推理轨迹进行细化。为维持训练过程中策略演化带来的对齐性,我们采用迭代学习方案,动态再生成偏好数据。针对三个医学 VQA 和报告生成基准进行大量实验,表明ClinCoT在事实 grounding 方面持续提效,并优于现有基于偏好的对齐方法。
引用
@article{arxiv.2603.01124,
title = {ClinCoT: Clinical-Aware Visual Chain-of-Thought for Medical Vision Language Models},
author = {Xiwei Liu and Yulong Li and Xinlin Zhuang and Xuhui Li and Jianxu Chen and Haolin Yang and Imran Razzak and Yutong Xie},
journal= {arXiv preprint arXiv:2603.01124},
year = {2026}
}