条件编织遇见专家调制:面向通用可控图像生成
计算机视觉与模式识别
2025-12-16 v3 人工智能
摘要
图像到图像生成任务旨在通过利用条件输入和提示指令来产生可控图像。然而,现有方法常为每种条件类型训练独立的控制分支,导致模型结构冗余且计算资源利用效率低下。为此,我们提出了统一的图像到图像生成(UniGen)框架,支持多样化的条件输入,同时提升生成效率和表达能力。具体而言,针对可控条件生成架构中普遍存在的参数冗余和计算效率问题,我们提出了条件调制专家(CoMoE)模块。该模块聚合语义相似的 patch 特征,并将其分配给专门的专家模块进行视觉表征和条件建模。通过使不同条件下前景特征的独立建模,CoMoE有效缓解了多条件场景中的特征交织和冗余计算。此外,为弥合主干与控制分支之间的信息差,我们提出了WeaveNet——一种动态的蛇形连接机制,实现了来自主干的全局文本级控制与来自条件分支的细粒度控制之间的有效互动。在Subjects-200K和MultiGen-20M数据集上的广泛实验表明,我们的方法在各种条件图像生成任务中始终实现了最先进的性能,验证了其在灵活性和有效性方面的优势。该代码已上传至https://github.com/gavin-gqzhang/UniGen。
引用
@article{arxiv.2508.17364,
title = {Condition Weaving Meets Expert Modulation: Towards Universal and Controllable Image Generation},
author = {Guoqing Zhang and Xingtong Ge and Lu Shi and Xin Zhang and Muqing Xue and Wanru Xu and Yigang Cen and Yidong Li},
journal= {arXiv preprint arXiv:2508.17364},
year = {2025}
}