中文

MedUnifier:基于离散视觉表征的医学数据视觉-语言预训练统一框架

计算机视觉与模式识别 2025-04-22 v3 人工智能

摘要

尽管视觉-语言预训练(VLP)取得了显著进展,但当前方法主要强调特征提取和跨模态理解,对生成或转换视觉内容的关注有限。这一差距限制了模型从文本提示合成连贯且新颖视觉表征的能力,从而降低了多模态学习的效果。本文提出MedUnifier,一个专为医学数据设计的统一VLP框架。MedUnifier无缝集成了文本导向的图像生成能力与多模态学习策略,包括图像-文本对齐、图像-文本匹配和图像导向文本生成。不同于依赖连续视觉表征的传统方法,本方法采用视觉向量量化,不仅有助于更一致的跨模态理解学习,还能通过有效利用离散表征提升多模态生成质量。实验在既定基准测试中验证了框架效能,包括单模态任务(监督微调)、跨模态任务(图像-文本检索和零样本图像分类)以及多模态任务(医学报告生成和图像合成),在各种任务中均实现了最先进的性能。MedUnifier还为广泛的语言和视觉医疗任务提供了高度可适应的工具,标志着向开发通用医学AI模型迈出了重要一步。

关键词

引用

@article{arxiv.2503.01019,
  title  = {MedUnifier: Unifying Vision-and-Language Pre-training on Medical Data with Vision Generation Task using Discrete Visual Representations},
  author = {Ziyang Zhang and Yang Yu and Yucheng Chen and Xulei Yang and Si Yong Yeo},
  journal= {arXiv preprint arXiv:2503.01019},
  year   = {2025}
}

备注

To be pubilshed in CVPR 2025