OminiControl2:面向扩散Transformer的高效条件控制
计算机视觉与模式识别
2025-03-12 v1 人工智能
摘要
文本到图像扩散Transformer模型(DiT)的细粒度控制仍是实际部署面临的关键挑战。尽管 OminiControl 等近期进展已实现对多种控制信号的可控生成,但这些方法在处理长条件输入时面临显著的计算低效性。我们提出 OminiControl2,一个实现高效图像条件图像生成的框架。OminiControl2 引入两项关键创新:(1)动态压缩策略,在生成过程中仅保留语义最相关的 token 以精简条件输入;(2)条件特征复用机制,仅计算一次条件 token 特征并在去噪步骤中复用。这些架构改进保留了原始框架的参数效率与多模态通用性,同时大幅降低了计算成本。实验表明,与其前代相比,OminiControl2 将条件处理开销降低超过 90%,在多条件生成场景中实现 5.9 的整体加速。这一效率使得在 DiT 模型中实际实现高质量图像合成的复杂多模态控制成为可能。
引用
@article{arxiv.2503.08280,
title = {OminiControl2: Efficient Conditioning for Diffusion Transformers},
author = {Zhenxiong Tan and Qiaochu Xue and Xingyi Yang and Songhua Liu and Xinchao Wang},
journal= {arXiv preprint arXiv:2503.08280},
year = {2025}
}