UnICLAM:基于对抗掩码对比表示学习的统一可解释医学视觉问答模型
计算机视觉与模式识别
2023-09-28 v3 人工智能
机器学习
摘要
医学视觉问答 (Medical-VQA) 旨在回答有关放射学图像的临床表现问题,辅助医生进行决策。然而,当前 Medical-VQA 模型通过置于双独立空间中的视觉与文本编码器学习跨模态表示,导致间接的语义对齐。本文中,我们提出 UnICLAM,一种通过对抗掩码对比表示学习的统一可解释 Medical-VQA 模型。具体而言,为学习对齐的图像-文本表示,我们首先建立具有渐进式软参数共享策略的统一双流预训练结构。技术上,所提策略学习一种约束使视觉与文本编码器在同一空间中接近,并随层数增高逐渐放松。此外,为掌握统一语义表示,我们将对抗掩码数据增强以统一方式扩展至视觉与文本的对比表示学习。具体地,在编码器训练最小化原始与掩码样本距离的同时,对抗掩码模块保持对抗学习以反向最大化该距离。进一步,我们还对统一对抗掩码增强模型进行了直观的深入探索,其以卓越性能与效率提升了潜在的 ante-hoc 可解释性。在 VQA-RAD 与 SLAKE 公开基准上的实验结果表明,UnICLAM 优于现有 11 个最先进的 Medical-VQA 模型。更重要的是,我们额外讨论了 UnICLAM 在心力衰竭诊断中的表现,验证其在实用疾病诊断中具有优越的少样本适配性能。
引用
@article{arxiv.2212.10729,
title = {UnICLAM:Contrastive Representation Learning with Adversarial Masking for Unified and Interpretable Medical Vision Question Answering},
author = {Chenlu Zhan and Peng Peng and Hongsen Wang and Tao Chen and Hongwei Wang},
journal= {arXiv preprint arXiv:2212.10729},
year = {2023}
}