通过扩散转换器实现免费个性化
计算机视觉与模式识别
2025-03-18 v1
摘要
个性化图像生成旨在生成用户指定概念的图像,同时实现灵活的编辑。最近的训练-free 方法虽在计算效率上优于训练-based 方法,但在身份保持、适用性和与扩散转换器(DiTs)的兼容性方面表现不佳。本文我们发现,DiT的潜在未被充分挖掘的潜力在于:仅通过将去噪标记替换为参考主题的标记,即可实现零-shot主题重建。这种简单而有效的特征注入技术 unlocks 从个性化到图像编辑的多种场景。基于此观察,我们提出了"任何都可以个性化"(Personalize Anything),一个训练-free 框架,通过以下方式在DiT中实现个性化图像生成:1) 基于时刻的自适应标记替换通过早期阶段注入实现主题一致性,并通过晚期阶段的正则化提升灵活性;2) 采用 patch 扰动策略以提升结构多样性。我们的方法无缝支持布局引导生成、多主题个性化和掩码控制编辑。评估表明,我们的方法在身份保持和通用性方面均实现了最先进的性能。我们的工作为理解DiTs的新颖见解,同时为高效个性化提供了实用范式。
引用
@article{arxiv.2503.12590,
title = {Personalize Anything for Free with Diffusion Transformer},
author = {Haoran Feng and Zehuan Huang and Lin Li and Hairong Lv and Lu Sheng},
journal= {arXiv preprint arXiv:2503.12590},
year = {2025}
}
备注
https://fenghora.github.io/Personalize-Anything-Page/