中文

PRIOR:基于医学图像与报告的原型表示联合学习

计算机视觉与模式识别 2024-03-12 v3

摘要

基于对比学习的视觉-语言联合预训练已成为一种成功的表示学习策略。本文中,我们提出一种融合医学图像与报告间全局与局部对齐的原型表示学习框架。与标准全局多模态对齐方法不同,我们采用局部对齐模块以实现细粒度表示。此外,设计了一种跨模态条件重构模块,通过在训练阶段重构被掩码的图像与报告来实现模态间信息互换。为重构长报告,我们构建了句子级原型记忆库,使网络能够聚焦于底层局部视觉与高层临床语言特征。另外,提出一种非自回归生成范式用于重构非序列化报告。在包括有监督分类、零样本分类、图像到文本检索、语义分割与目标检测在内的五项下游任务上的实验结果表明,所提方法在多个数据集及不同数据集规模设定下均优于其他最先进方法。代码已发布于 https://github.com/QtacierP/PRIOR。

关键词

引用

@article{arxiv.2307.12577,
  title  = {PRIOR: Prototype Representation Joint Learning from Medical Images and Reports},
  author = {Pujin Cheng and Li Lin and Junyan Lyu and Yijin Huang and Wenhan Luo and Xiaoying Tang},
  journal= {arXiv preprint arXiv:2307.12577},
  year   = {2024}
}

备注

Accepted by ICCV 2023