MAUGen:面向多身份人脸表情与 AU 标签生成的统一扩散方法
计算机视觉与模式识别
2026-02-03 v1 人工智能
摘要
大规模、具有代表性的人脸图像缺乏精确的动作单元 (AU) 发生情况和强度标注,这长期是开发通用 AU 识别系统的根本性瓶颈。本文提出了 MAUGen,一种基于扩散的多模态框架,能够在单个描述性文本提示下联合生成大量逼真的人脸表情以及解剖学一致的 AU 标签,包括发生情况和强度。我们的 MAUGen 包含两个关键模块:(1) 多模态表示学习 (MRL) 模块,用于在统一的潜在空间中捕获paired textual description、人脸身份、expression image 和 AU activations 之间的关系;(2) 基于扩散的图像标签生成器 (DIG),将联合表示解码为跨身份的aligned facial image-label 对。该框架下,我们引入了 Multi-Identity Facial Action (MIFA),一个大型多模态合成数据集,包含全面的 AU 标注和身份变化。广泛的实验表明,MAUGen 在合成逼真、具有代表性的人脸图像以及语义对齐的 AU 标签方面优于现有方法。
引用
@article{arxiv.2602.00583,
title = {MAUGen: A Unified Diffusion Approach for Multi-Identity Facial Expression and AU Label Generation},
author = {Xiangdong Li and Ye Lou and Ao Gao and Wei Zhang and Siyang Song},
journal= {arXiv preprint arXiv:2602.00583},
year = {2026}
}