您的潜在掩码是错误的:基于像素等效潜在合成的扩散模型
计算机视觉与模式识别
2025-12-08 v1 图形学
机器学习
摘要
扩散模型中的潜在填充仍几乎普遍依赖于在下采样掩码下对VAE潜在变量进行线性插值。我们提出了潜在合成的关键原则:像素等效潜在合成(PELC)。等效潜在合成器应与像素空间的合成完全相同。这一原则实现了完全分辨率的掩码控制和真正的软边alpha合成,尽管VAEs在空间上压缩了8倍。现代VAEs捕获了全局上下文,超越了patch对齐的局部结构,因此线性潜在混合无法实现像素等效:它会在掩码接缝处产生大量瑕疵,导致整体性能下降和颜色偏移。我们引入DecFormer,一款7.7百万参数的transformer,用于预测每个通道的混合权重并施加off-manifold残差校正,以实现掩码一致的潜在融合。DecFormer经过训练,解码后的融合结果与像素空间alpha合成匹配,兼容现有扩散管线,无需微调主干网络,仅增加0.07%的FLUX.1-Dev参数,增加3.5%的FLOP开销。在FLUX.1系列上,DecFormer恢复了全局颜色一致性,支持软掩码,锐利边界,以及高保真掩码,使边缘错误指标降低最高可达53%。作为填充先验使用,配合DecFormer的轻量级LoRA在FLUX.1-Dev上实现的保真度相当于FLUX.1-Fill——一个完全微调的填充模型。虽然我们专注于填充,但PELC是一种通用的像素等效潜在编辑配方,我们还在一个复杂的颜色校正任务中演示了其应用。
引用
@article{arxiv.2512.05198,
title = {Your Latent Mask is Wrong: Pixel-Equivalent Latent Compositing for Diffusion Models},
author = {Rowan Bradbury and Dazhi Zhong},
journal= {arXiv preprint arXiv:2512.05198},
year = {2025}
}
备注
16 pages, 10 figures