中文

领域特定潜在表征提升扩散模型在医学图像超分辨率中的保真度

计算机视觉与模式识别 2026-04-15 v1 人工智能

摘要

医学图像超分辨率的潜在扩散模型普遍继承了为自然照片设计的变分自编码器(VAE)。我们指出,这一默认选择而非扩散架构,是重建质量的主要约束因素。在保持其他管道组件固定的控制实验中,用在超过 160 万张医学图像上预训练的 MedVAE 替代通用 Stable Diffusion VAE,可在髋关节 MRI、脑 MRI 和胸 X 光(样本数 n=1,820;Cohen's d=1.37~1.86,所有 p<10^{-20},威尔科森秩检验)上实现 +2.91~+3.29 dB 的 PSNR 提升。小波分解将优势局部化到最细空间频率带,编码解剖学相关的细节结构。对推断时间表、预测目标和生成式架构进行消融实验确认,差距在 ±0.15 dB 范围内保持稳定,而幻觉率在不同方法之间保持可比(所有数据集上的 Cohen's h<0.02),表明重建保真度与生成式幻觉由独立的管道组件决定。这些结果提供了实用的筛选标准:即时在无扩散训练的情况下测量的自编码器重建质量可预测下游超分辨性能(R²=0.67),建议在搜索扩散架构之前应优先选择领域特定的 VAE。代码和训练好的模型权重已公开发布于 https://github.com/sebasmos/latent-sr。

关键词

引用

@article{arxiv.2604.12152,
  title  = {Domain-Specific Latent Representations Improve the Fidelity of Diffusion-Based Medical Image Super-Resolution},
  author = {Sebastian Cajas and Ashaba Judith and Rahul Gorijavolu and Sahil Kapadia and Hillary Clinton Kasimbazi and Leo Kinyera and Emmanuel Paul Kwesiga and Sri Sri Jaithra Varma Manthena and Luis Filipe Nakayama and Ninsiima Doreen and Leo Anthony Celi},
  journal= {arXiv preprint arXiv:2604.12152},
  year   = {2026}
}