Med-K2N:医学图像合成的灵活K至N模态翻译
计算机视觉与模式识别
2025-10-06 v1
摘要
跨模态医学图像合成研究聚焦于从可用模态数据重建缺失的成像模态,以支持临床诊断。鉴于临床对灵活模态重建的需求,我们探索K至N医学生成,其中三个关键挑战浮现:如何建模不同模态对各种目标任务的异构贡献?如何确保融合质量控制以防止噪声信息的降级?如何在多输出生成中保持模态身份一致性?鉴于这些临床需求,并借鉴SAM2的顺序帧范式以及医生逐步添加和选择性整合多模态信息的工作流程,我们将多模态医学数据视为具有质量驱动选择机制的顺序帧。我们的核心思想是为每个模态-任务对学习自适应权重,并通过渐进式增强记忆有益的融合模式。为实现这一目标,我们设计了三个协作模块:用于全局贡献评估的PreWeightNet,用于自适应过滤的ThresholdNet,用于有效权重计算的EffiWeightNet。同时,为保持模态身份一致性,我们提出了因果模态身份模块(CMIM),通过视觉语言建模在生成图像与目标模态描述之间建立因果约束。大量实验结果表明,我们提出的Med-K2N在多个基准测试中均显著优于最先进的方法。源代码已公开。
引用
@article{arxiv.2510.02815,
title = {Med-K2N: Flexible K-to-N Modality Translation for Medical Image Synthesis},
author = {Feng Yuan and Yifan Gao and Yuehua Ye and Haoyue Li and Xin Gao},
journal= {arXiv preprint arXiv:2510.02815},
year = {2025}
}
备注
ICLR2026 under review