中文

基于解耦注意力机制的多变量扩散变换器用于高保真遮罩-文本协作式人脸生成

计算机视觉与模式识别 2026-01-08 v2 人工智能

摘要

尽管在使用语义遮罩和文本描述实现多模态人脸生成方面取得了显著进展,但常规的特征融合方法往往难以实现有效的跨模态交互,从而导致生成效果不佳。为解决此挑战,我们提出了 MDiTFace——一个定制化的扩散变换器框架,采用统一的分词策略处理语义遮罩和文本输入,消除异构模态表征之间的差异。该框架通过堆叠新设计的多变量变换器模块实现全面的多模态特征交互,这些模块同步处理所有条件。此外,我们设计了一种新颖的解耦注意力机制,通过分离遮罩标记与时间嵌入之间的隐式依赖来实现。该机制将内部计算分为动态路径和静态路径,使静态路径中计算得到的特征可被缓存和重用,从而在保持性能的前提下,将由遮罩条件引入的额外计算开销降低超过94%。大量实验表明,MDiTFace 在人脸保真度和条件一致性方面均显著优于其他竞争方法。

关键词

引用

@article{arxiv.2511.12631,
  title  = {Multivariate Diffusion Transformer with Decoupled Attention for High-Fidelity Mask-Text Collaborative Facial Generation},
  author = {Yushe Cao and Dianxi Shi and Xing Fu and Xuechao Zou and Haikuo Peng and Xueqi Li and Chun Yu and Junliang Xing},
  journal= {arXiv preprint arXiv:2511.12631},
  year   = {2026}
}