Edit2Perceive:图像编辑扩散模型是强大的稠密感知器
计算机视觉与模式识别
2025-11-25 v1
摘要
近期的扩散变换器研究在视觉合成方面展现出惊人的泛化能力,但大多数稠密感知方法仍依赖为随机生成而设计的文本到图像(T2I)生成器。我们重新审视这一范式,表明图像编辑扩散模型本质上是图像到图像一致的,为稠密感知任务提供了更合适的基础。我们引入Edit2Perceive,一个统一的扩散框架,将编辑模型适用于深度、法线和抠图任务。基于FLUX.1 Kontext架构,我们的方法采用全参数微调和像素空间一致性损失,以确保跨中间去噪状态的结构保持细化。此外,我们的单步确定性推理可实现更快的运行时,同时在相对较小的数据集上进行训练。广泛的实验表明,在所有三个任务上均实现了全面的最新结果,揭示了面向几何感知的编辑导向扩散变换器的强大潜力。
引用
@article{arxiv.2511.18673,
title = {Edit2Perceive: Image Editing Diffusion Models Are Strong Dense Perceivers},
author = {Yiqing Shi and Yiren Song and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2511.18673},
year = {2025}
}