面向医学视觉问答的Step-CoT:基于逐步视觉链式思考
计算机视觉与模式识别
2026-03-17 v1 人工智能
计算与语言
摘要
链式思维(CoT)推理已推动了医学视觉问答(VQA)的发展,但大多数现有CoT论证是自由形式的,无法捕捉临床医生实际遵循的结构化推理过程。本工作询问:是否可以通过可追溯的多步骤推理监督来提高推理准确性和医学VQA的可解释性?为此,我们引入Step-CoT,这是一个由专家精选的结构化多步骤CoT与临床诊断工作流程对齐的大型医学推理数据集,隐式地将模型的推理置于放射学证据之下。Step-CoT包含超过1万个真实临床病例和7万个VQA对,围绕诊断工作流程组织,提供受监督的中间步骤,以引导模型遵循有效的推理轨迹。为有效地从Step-CoT学习,我们进一步引入了基于动态图结构聚焦机制的教师-学生框架,该机制优先考虑具有诊断信息的步骤,同时过滤掉不相关的上下文。我们的实验表明,使用Step-CoT可以提高推理准确性和可解释性。基准:github.com/hahaha111111/Step-CoT。数据集卡:huggingface.co/datasets/fl-15o/Step-CoT
引用
@article{arxiv.2603.13878,
title = {Step-CoT: Stepwise Visual Chain-of-Thought for Medical Visual Question Answering},
author = {Lin Fan and Yafei Ou and Zhipeng Deng and Pengyu Dai and Hou Chongxian and Jiale Yan and Yaqian Li and Kaiwen Long and Xun Gong and Masayuki Ikebe and Yefeng Zheng},
journal= {arXiv preprint arXiv:2603.13878},
year = {2026}
}
备注
Accepted by CVPR 2026 Finding Track