中文

E-MD3C:驯服掩码扩散 Transformer 以实现高效零样本物体定制

计算机视觉与模式识别 2025-02-14 v1 机器学习

摘要

我们提出 E-MD3C(高效掩码扩散 Transformer,具有解耦条件与紧凑收集器),一个用于零样本物体图像定制的高效框架。与先前依赖资源密集型 Unet 架构的工作不同,我们的方法采用在潜在图像块上运行的轻量级掩码扩散 Transformer,显著提高了计算效率。该框架集成了三个核心组件:(1) 一个用于处理自编码器潜在表示的高效掩码扩散 Transformer,(2) 一种解耦条件设计,在保持背景对齐和精细细节的同时确保紧凑性,以及 (3) 一个可学习的条件收集器,将多个输入整合为紧凑表示,以实现高效的去噪和学习。E-MD3C 在 VITON-HD 数据集上的 PSNR、FID、SSIM 和 LPIPS 等指标上优于现有方法,在参数、内存效率和推理速度方面展现出明显优势。仅使用 1/4 的参数,我们基于 Transformer 的 468M 模型比基于 Unet 的 1720M 潜在扩散模型推理速度快 2.5 倍,且仅使用 2/3 的 GPU 内存。

引用

@article{arxiv.2502.09164,
  title  = {E-MD3C: Taming Masked Diffusion Transformers for Efficient Zero-Shot Object Customization},
  author = {Trung X. Pham and Zhang Kang and Ji Woo Hong and Xuran Zheng and Chang D. Yoo},
  journal= {arXiv preprint arXiv:2502.09164},
  year   = {2025}
}

备注

16 pages, 14 figures