CheXmix:面向医学影像的统一生成式预训练框架
计算机视觉与模式识别
2026-04-28 v1 人工智能
摘要
最近的医学多模态基础模型是通过将CLIP预训练的视觉编码器连接到LLM并采用LLaVA式微调来构建的。这两种方法引入了一个投影层,可能扭曲视觉特征。这在医学影像中尤其令人关注,因为精细的线索对于准确诊断至关重要。相比之下,早期融合生成方法如Chameleon通过在单个统一序列中处理图像和文本标记,消除了投影瓶颈,实现了联合表征学习,利用语言模型的归纳先验。我们提出了CheXmix,一个在大型胸片X光图像与放射科报告配对数据集上进行训练的统一早期融合生成模型。我们在Chameleon的自回归框架基础上引入了两种阶段的多模态生成式预训练策略,将masked autoencoder的表征优势与MLLM相结合。所得模型高度灵活,支持粗粒度和细粒度的判别性和生成式任务。我们的做法在所有遮蔽比例下均优于已建立的生成模型,提高了6.0%;在CheXpert分类任务中,在高遮蔽比例下将CheXagent的AUROC提升8.6%。我们进一步比文本单一生成模型在图像修复方面提高了51.0%,在绿色指标(GREEN)上对放射科报告生成 outperform CheXagent 提升了45%。这些结果表明,CheXmix能够捕获胸片X光任务中广泛spectrum 的细粒度信息。我们的代码可在 https://github.com/StanfordMIMI/CheXmix 查看。
引用
@article{arxiv.2604.22989,
title = {CheXmix: Unified Generative Pretraining for Vision Language Models in Medical Imaging},
author = {Ashwin Kumar and Robbie Holland and Corey Barrett and Jangwon Kim and Maya Varma and Zhihong Chen and Yunhe Gao and Greg Zaharchuk and Tara Taghavi and Krishnaram Kenthapadi and Akshay Chaudhari},
journal= {arXiv preprint arXiv:2604.22989},
year = {2026}
}
备注
CVPR Findings (2026)