中文

VITAL:面向医学多模态大语言模型的视觉-语义双导师隐式推理

计算机视觉与模式识别 2026-05-28 v1 人工智能

摘要

隐式推理通过连续隐藏状态而非显式标记实现推理,可避免链式思考在医学视觉问答中的语言瓶颈和推理开销。然而,现有方法 suffer from 模态坍缩、视觉监督不足以及训练-推理不匹配。此外,其不透明的隐式状态在临床应用中缺乏可解释性。我们提出 VITAL,一种针对医学多模态大语言模型的隐式空间推理框架,采用视觉-语义双导师监督:辅助文本解码器从隐式状态重建推理链,而视觉投影器从冻结的独立医学视觉编码器中回归 ROI 特征。两个模块在推理时被丢弃,开销为零,但可事后重新连接以实现双重可解释性,提供文本和视觉解释,无需牺牲效率。我们构建了覆盖9种成像模态的61K数据集,规模是现有医学视觉隐式推理数据集的十倍。实验在7个基准上显示,VITAL 在各项指标上均显著优于基线模型、所有隐式推理方法以及训练数据远大于本方法的医学多模态大语言模型,实现了与万亿参数专有模型相当的领先成绩。

关键词

引用

@article{arxiv.2605.28422,
  title  = {VITAL: Visual-Semantic Dual Supervision for Enhanced and Interpretable Latent Reasoning in Medical MLLMs},
  author = {Qiaoru Li and Shaotian Liang and Jintao Chen and Haoran Sun and Yuxiang Cai and Jianwei Yin and Yankai Jiang},
  journal= {arXiv preprint arXiv:2605.28422},
  year   = {2026}
}