OminiControl:扩散Transformer的最小化通用控制
计算机视觉与模式识别
2025-07-08 v6 人工智能
机器学习
摘要
我们提出OminiControl,一种重新思考图像条件如何集成到扩散Transformer(DiT)架构中的新方法。当前图像条件方法要么引入显著的参数开销,要么只能有效处理特定控制任务,限制了其实际灵活性。OminiControl通过三种关键创新措施克服了这些限制:(1)一种最小化的架构设计,利用DiT自身的VAE编码器和Transformer块,仅需0.1%的额外参数;(2)一种统一的序列处理策略,将条件标记与图像标记组合,以实现灵活的标记交互;(3)一种动态位置编码机制,可适应空间对齐和非对齐控制任务。我们的大量实验表明,这种简洁的方法不仅能匹配而且超越了在多个条件任务上的专用方法。为克服subject-driven生成中数据限制,我们还引入了Subjects200K,一个由DiT模型自身合成的身份一致图像对的大型数据集。本工作表明,在无需架构复杂性的情况下,仍可实现有效的图像控制,为高效且通用的图像生成系统开辟了新的可能性。
引用
@article{arxiv.2411.15098,
title = {OminiControl: Minimal and Universal Control for Diffusion Transformer},
author = {Zhenxiong Tan and Songhua Liu and Xingyi Yang and Qiaochu Xue and Xinchao Wang},
journal= {arXiv preprint arXiv:2411.15098},
year = {2025}
}
备注
Accepted to ICCV 2025