面向医学视觉-语言预训练的多任务成对掩码与对齐建模
计算机视觉与模式识别
2023-10-24 v3 多媒体
摘要
近年来,医学影像诊断日益增长的需求给放射科医生带来了沉重负担。为此,研究者提出了医学视觉-语言预训练(Med-VLP)方法,从医学图像与报告中学习通用表征,使下游任务无需细粒度标注即可受益。然而,现有方法忽视了联合图像-文本重建中跨模态对齐的重要性,导致跨模态交互不足。为克服该局限,我们提出一种基于多任务成对掩码与对齐(MPMA)的统一Med-VLP框架,将跨模态对齐任务整合进联合图像-文本重建框架以实现更充分的跨模态交互,同时设计全局与局部对齐(GLA)模块以辅助自监督范式获取富含领域知识的语义表征。此外,我们引入记忆增强跨模态融合(MA-CMF)模块,充分整合视觉信息以辅助报告重建并充分融合多模态表征。实验结果表明,所提统一方法在所有下游任务(包括单模态、跨模态与多模态任务)上均优于以往方法。
引用
@article{arxiv.2305.07920,
title = {Multi-task Paired Masking with Alignment Modeling for Medical Vision-Language Pre-training},
author = {Ke Zhang and Yan Yang and Jun Yu and Hanliang Jiang and Jianping Fan and Qingming Huang and Weidong Han},
journal= {arXiv preprint arXiv:2305.07920},
year = {2023}
}