基于有限计算资源下的动量自蒸馏提升医学视觉语言预训练
计算机视觉与模式识别
2025-12-03 v1 人工智能
摘要
在医疗保健领域,获取详细标注数据具有挑战性,这凸显了鲁棒视觉语言模型(VLMs)的需求。预训练的 VLMs 可在小数据集上进行微调或实现零样例推理,实现性能可与任务特定模型相当。对比学习(CL)是训练 VLMs 的关键范式,但其本质上需要较大的批量大小才能有效学习,这使得计算需求高昂,往往仅限于资源充足的机构。此外,在医疗数据有限的情况下,重要的是在训练期间优先从数据和模型中提取知识以提升性能。因此,我们聚焦于结合动量方法与蒸馏技术,以同时解决计算效率和知识利用问题。我们的工作贡献可以总结如下:(1) 利用动量自蒸馈增强多模态学习;(2) 将动量机制与梯度累积集成,以无需增加资源消耗的方式扩大有效批量大小。我们的方法在零样例分类中实现了与最先进(SOTA)方法相当的性能,同时在少样本适应中实现显著提升,AUC-ROC 超过 90%,在检索任务中提升 2-3%。重要的是,我们的方法在单 GPU 上实现了高训练效率,同时保持合理的训练时间。我们的目标是通过降低资源要求来推动高效多模态学习的发展,同时在性能上超越 SOTA 方法。我们的实现代码已公开于 https://github.com/phphuc612/MSD。
引用
@article{arxiv.2512.02438,
title = {Boosting Medical Vision-Language Pretraining via Momentum Self-Distillation under Limited Computing Resources},
author = {Phuc Pham and Nhu Pham and Ngoc Quoc Ly},
journal= {arXiv preprint arXiv:2512.02438},
year = {2025}
}
备注
WACV 2026