MMFace-DiT:用于高保真多模态人脸生成的双流扩散Transformer
摘要
最近的多模态人脸生成模型通过用空间先验(如分割掩码、草图或边缘图)增强基于文本的条件控制,解决了文本到图像扩散模型的空间控制局限性。这种多模态融合使得可控合成能够同时与高层语义意图和低层结构布局对齐。然而,大多数现有方法通常通过附加辅助控制模块或拼接独立的单模态网络来扩展预训练的文本到图像流水线。这些临时设计继承了架构约束,参数重复,并且常常在冲突模态或错配的潜在空间下失败,限制了它们在语义和空间领域进行协同融合的能力。我们引入了MMFace-DiT,一个统一的、专为协同多模态人脸合成设计的双流扩散Transformer。其核心创新在于一个双流Transformer块,该块并行处理空间(掩码/草图)和语义(文本)词元,并通过共享的旋转位置嵌入(RoPE)注意力机制进行深度融合。这种设计防止了模态主导,并确保对文本和结构先验的强遵循,从而实现前所未有的空间-语义一致性可控人脸生成。此外,一种新颖的模态嵌入器使得单个统一模型能够动态适应不同的空间条件而无需重新训练。MMFace-DiT在视觉保真度和提示对齐方面比六个最先进的多模态人脸生成模型提升了40%,为端到端可控生成建模建立了一个灵活的新范式。代码和数据集可在我们的项目页面获取:https://vcbsl.github.io/MMFace-DiT/
引用
@article{arxiv.2603.29029,
title = {MMFace-DiT: A Dual-Stream Diffusion Transformer for High-Fidelity Multimodal Face Generation},
author = {Bharath Krishnamurthy and Ajita Rattani},
journal= {arXiv preprint arXiv:2603.29029},
year = {2026}
}
备注
Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026. 22 pages (Main Text + Supplementary), 14 figures, 5 tables, 4 algorithms. Project page: https://vcbsl.github.io/MMFace-DiT/ and Code Repository: https://github.com/Bharath-K3/MMFace-DiT