基于视觉-语言预训练的医疗图像与文本多模态理解与生成
计算机视觉与模式识别
2022-09-22 v3
摘要
近来,若干研究通过扩展BERT架构并采用多模态预训练目标,在图像描述与视觉问答等多样视觉-语言多模态任务上展现出令人印象深刻的性能。本工作中,我们探索医疗领域中广泛的多模态表示学习任务,具体使用放射学图像与非结构化报告。我们提出Medical Vision Language Learner (MedViLL),其采用基于BERT的架构并结合新颖的多模态注意力掩码方案,以最大化视觉-语言理解任务(诊断分类、医学图像-报告检索、医学视觉问答)与视觉-语言生成任务(放射学报告生成)的泛化性能。通过在四个下游任务上以三个放射图像-报告数据集(MIMIC-CXR、Open-I与VQA-RAD)对 proposed 模型进行统计严谨评估,我们凭经验证明MedViLL相对于包括任务专用架构在内的各类基线具有更优的下游任务性能。源代码公开于:https://github.com/SuperSupermoon/MedViLL
引用
@article{arxiv.2105.11333,
title = {Multi-modal Understanding and Generation for Medical Images and Text via Vision-Language Pre-Training},
author = {Jong Hak Moon and Hyungyung Lee and Woncheol Shin and Young-Hak Kim and Edward Choi},
journal= {arXiv preprint arXiv:2105.11333},
year = {2022}
}
备注
Accepted by IEEE Journal of Biomedical and Health Informatics