基于扩散转换器的全局与局部专家混合用于可控人脸生成
计算机视觉与模式识别
2025-09-03 v1
摘要
可控人脸生成在生成模型中面临关键挑战,需在语义可控性和照片实用性之间取得精细平衡。虽然已有方法在生成管道中难以 disentangle 语义控制,但我们通过专家专业化的视角重新审视扩散转换器 (Diffusion Transformers, DiTs) 的架构潜力。本文引入 Face-MoGLE 框架,包含:(1)通过掩码条件化空间分解实现语义解耦潜在建模, enables 精确属性操控;(2)全局与局部专家混合结构,捕获整体结构和区域级语义,实现精细可控性;(3)动态门控网络产生随扩散步骤和空间位置演化的时间依赖系数。Face-MoGLE 提供了一种强大且灵活的高质量可控人脸生成解决方案,在生成模型和安全应用领域具有广阔潜力。大量实验表明其在多模态和单模态人脸生成场景中均表现出色,具备强大的零样本泛化能力。项目页面可访问于 https://github.com/XavierJiezou/Face-MoGLE。
引用
@article{arxiv.2509.00428,
title = {Mixture of Global and Local Experts with Diffusion Transformer for Controllable Face Generation},
author = {Xuechao Zou and Shun Zhang and Xing Fu and Yue Li and Kai Li and Yushe Cao and Congyan Lang and Pin Tao and Junliang Xing},
journal= {arXiv preprint arXiv:2509.00428},
year = {2025}
}
备注
14 pages, 11 figures