SynerMedGen: 通过任务对齐融合医学多模态理解与生成
计算机视觉与模式识别
2026-05-12 v1
摘要
将多模态理解与生成统一是医疗领域正在出现的亮人前沿。然而,现有有限的统一医学模型通常将理解与生成视为互斥的目标,缺乏有意义的功能协同。本文识别并解决统一医学建模中的一个关键问题:何种形式的理解真正有助于生成。我们提出SynerMedGen,一个基于生成对齐理解原则的统一框架,通过任务对齐融合理解目标与生成任务。SynerMedGen引入了三个生成对齐理解任务和一个两阶段训练策略,将理解训练中学习到的有利于生成的表征传递到医学图像合成。值得注意的是,尽管仅进行理解训练,SynerMedGen在22个医学图像合成任务上均实现了强大的零样性能,并对未见数据集表现出鲁健的泛化能力。当结合生成训练时,SynerMedGen consistently优于当前最先进的专业医学图像合成模型以及最近的统一医学模型。我们还发布了一个大规模数据集,名为SynerMed,包含100万对合成样本和200万生成派生的理解实例,以支持进一步的理解-生成协同研究。我们的项目可在https://github.com/Mhilab/SynerMedGen访问。
引用
@article{arxiv.2605.08724,
title = {SynerMedGen: Synergizing Medical Multimodal Understanding with Generation via Task Alignment},
author = {Weiren Zhao and Yi Dong and Cheng Chen},
journal= {arXiv preprint arXiv:2605.08724},
year = {2026}
}
备注
Accepted by ICML 2026