多模态特权知识蒸馏在两种基于视觉转换器的诊断应用中的有效性
计算机视觉与模式识别
2025-08-12 v1 机器学习
摘要
在临床实践中部署深度学习模型通常需要利用图像、文本和结构化数据等多种数据模态,以实现稳健可靠的决策。然而,到推理时刻时,并非所有模态都可用。在本工作中,我们提出了多模态特权知识蒸馏 (MMPKD),这是一种训练策略,利用仅在训练时可用的额外模态来指导单模态视觉模型。具体而言,我们为胸片 (MIMIC-CXR) 使用基于文本的教师模型,为乳腺钼片 (CBIS-DDSM) 使用基于表格元数据的教师模型,将知识蒸馈到视觉转换器学生模型中。我们表明,MMPKD 可以提高注意力图在零样本情况下局部定位输入图像中ROI的能力,而这一效果并不跨域普遍化,与先前研究的假设相反。
引用
@article{arxiv.2508.06558,
title = {On the effectiveness of multimodal privileged knowledge distillation in two vision transformer based diagnostic applications},
author = {Simon Baur and Alexandra Benova and Emilio Dolgener Cantú and Jackie Ma},
journal= {arXiv preprint arXiv:2508.06558},
year = {2025}
}