通过软提示统一医学视觉-语言预训练
计算机视觉与模式识别
2023-02-20 v1
摘要
医学视觉-语言预训练(Med-VLP)因能从医学图像和文本中提取通用表征,在许多下游医学任务上展现出可观的提升。实际上,根据是否使用重型融合模块,存在两种典型类型,即融合编码器型和双编码器型。前者因模态间充分交互而在多模态任务上占优;后者因单模态编码能力而在单模态和跨模态任务上表现良好。为兼顾这两类优势,我们提出一种有效且简洁的方案 PTUnifier 来统一这两种类型。我们首先通过引入视觉和文本提示来统一输入格式,这些提示充当存储最具代表性图像/文本的特征库。如此,单一模型即可作为基础模型(foundation model),处理采用不同输入格式(即仅图像、仅文本和图像-文本对)的各种任务。此外,我们构建了一个提示池(而非静态提示)以提升多样性和可扩展性。实验结果表明,我们的方法在广泛任务上取得了最先进(state-of-the-art)结果,涵盖单模态任务(即图像/文本分类和文本摘要)、跨模态任务(即图像到文本生成和图像-文本/文本-图像检索)以及多模态任务(即视觉问答),证明了方法的有效性。需注意,提示的采用与大多数现有 Med-VLP 方法正交,可作为对这些方法有益且互补的扩展。
引用
@article{arxiv.2302.08958,
title = {Towards Unifying Medical Vision-and-Language Pre-training via Soft Prompts},
author = {Zhihong Chen and Shizhe Diao and Benyou Wang and Guanbin Li and Xiang Wan},
journal= {arXiv preprint arXiv:2302.08958},
year = {2023}
}
备注
Work in progress