中文

医疗潜在扩散模型的可学习性差距

计算机视觉与模式识别 2026-05-19 v1

摘要

潜在扩散模型用于医学影像生成数据增强以解决类别不平衡是一种有前景的策略,但当前方法聚焦于感知保真度和领域特定的自动编码器微调,而忽略了更根本的瓶颈。我们识别并形式化了可学习性差距:大规模预训练的自动编码器在重构空间中忠实地编码医学分类的判别特征,证据在于接近无损失的重建性能,但其潜在表示的结构使得分类器难以学习。在五种自动编码器家族和四个医学基准(胸部X光、皮肤病变、CT和超声心动图)上,我们展示了该差距在体系结构、初始化策略或超参数调优的情况下仍然存在,医学领域的自动编码器微调也无法弥合。为探索并部分缩小差距,我们发展出噪声条件潜在分类器,集成FiLM层和图像空间蒸馏,相较于图像空间模型实现64倍吞吐量和120倍内存收益,同时作为潜在空间质量的诊断工具。我们的分析提供了一种新的框架用于评估自动编码器的潜在空间,并指出其结构而非保真度或领域特异性是导致真实与合成医学训练数据之间性能差距的主要障碍。

关键词

引用

@article{arxiv.2605.17087,
  title  = {The Learnability Gap in Medical Latent Diffusion},
  author = {Mischa Dombrowski and Felix Nützel and Bernhard Kainz},
  journal= {arXiv preprint arXiv:2605.17087},
  year   = {2026}
}