中文

LCUDiff:用于可靠人体恢复的潜在容量升级扩散模型

计算机视觉与模式识别 2026-02-05 v1

摘要

现有的人体相关图像恢复方法常常在恢复保真度方面存在不足,尤其是在人体恢复(HBR)方面。最近的基于扩散的恢复方法通常采用预训练的文本到图像扩散模型,其中变分自编码器(VAE)会显著成为恢复保真度的瓶颈。我们提出了 LCUDiff,一个稳定的单步框架,通过将预训练潜在扩散模型的潜在空间从 4 通道升级到 16 通道来提升容量。对于 VAE 微调,我们采用通道分割蒸馏(CSD)以保持前四个通道与预训练先验的一致性,同时分配额外通道有效地编码高频细节。我们进一步设计了先验保留适应(PPA)以平滑地桥接 4 通道扩散主干网络与更高维度 16 通道潜在空间之间的差异。此外,我们提出了解码器路由器(DeR),用于基于恢复质量评分注释进行逐样本解码器路由,这有助于在多样化条件下提升视觉质量。在合成数据集和真实世界数据集上的实验表明,LCUDiff 在轻度退化条件下以竞争的结果实现更高的保真度和更少的伪影,同时保持单步效率。代码和模型将在 https://github.com/gobunu/LCUDiff 提供。

关键词

引用

@article{arxiv.2602.04406,
  title  = {LCUDiff: Latent Capacity Upgrade Diffusion for Faithful Human Body Restoration},
  author = {Jue Gong and Zihan Zhou and Jingkai Wang and Shu Li and Libo Liu and Jianliang Lan and Yulun Zhang},
  journal= {arXiv preprint arXiv:2602.04406},
  year   = {2026}
}

备注

8 pages, 7 figures. The code and model will be at https://github.com/gobunu/LCUDiff