用于医学视觉-语言预训练的多模态掩码自编码器
计算机视觉与模式识别
2022-09-16 v1 计算与语言
摘要
医学视觉-语言预训练提供了一种从医学图像和文本中提取有效视觉-语言表征的可行方案。然而,很少有研究致力于该领域以促进医学视觉-语言理解。在本文中,我们提出了一种基于多模态掩码自编码器(MAE)的自监督学习范式,其通过从随机掩码的图像和文本中重建缺失的像素和词元来学习跨模态领域知识。为使这一简单方法奏效,有三个关键设计。首先,考虑到视觉和语言的信息密度不同,我们对输入图像和文本采用不同的掩码比例,其中对图像使用相当大的更大掩码比例。其次,我们使用来自不同层的视觉和文本特征进行重建,以处理视觉和语言中不同层次的抽象。第三,我们为视觉和语言解码器开发了不同的设计(即,视觉使用 Transformer,语言使用多层感知机)。为进行全面的评估并促进进一步研究,我们构建了一个包含三项任务的医学视觉-语言基准。实验结果证明了我们方法的有效性,在所有下游任务上均取得了最先进(SOTA)结果。此外,我们进行了进一步分析以更好地验证我们方法各组件的有效性以及预训练的各种设置。源代码可在 \url{https://github.com/zhjohnchan/M3AE} 获取。
引用
@article{arxiv.2209.07098,
title = {Multi-Modal Masked Autoencoders for Medical Vision-and-Language Pre-Training},
author = {Zhihong Chen and Yuhao Du and Jinpeng Hu and Yang Liu and Guanbin Li and Xiang Wan and Tsung-Hui Chang},
journal= {arXiv preprint arXiv:2209.07098},
year = {2022}
}
备注
Natural Language Processing. 11 pages, 3 figures