基于 FACS 对齐的面部行为细粒度合成的新型解剖学文本描述范式
计算机视觉与模式识别
2026-04-03 v2 多媒体
摘要
面部行为是人类非语言交流的主要媒介。现有合成方法主要遵循两种范式:粗糙的情感类别标签或来自面部动作编码系统 (FACS) 的独热动作单元 (AU) 向量。这两种范式都无法可靠地渲染细粒度的面部行为,也无法解决由冲突 AU 导致的解剖学不合理 artifacts。因此,我们提出了一种新颖的任务范式:基于 FACS 的 AU 描述进行解剖学导向的面部行为合成。该范式显式地将 FACS 定义的肌肉运动规则、AU 之间的相互作用以及冲突解决机制编码为自然语言控制信号。为促进系统化的研究,我们开发了一个动态 AU 文本处理器,将原始 AU 注释转换为解剖学一致的自然语言描述。使用该处理器,我们构建了 BP4D-AUText 数据集,这是第一个用于细粒度面部行为合成的大规模文本-图像配对数据集,包含超过 30.2 万个高质量样本。鉴于现有的通用语义一致性指标无法捕捉解剖学面部描述与合成肌肉运动之间的对齐性,我们提出了 AU 概率分布对齐准确率 (AAAD) 指标,用于量化语义一致性。最后,我们设计了 VQ-AUFace 框架,融合解剖学先验知识和渐进式跨模态对齐,作为基线方法进行验证。广泛的定量实验和用户研究表明,该范式在各类方法中均显著优于最先进的方法,尤其在处理冲突 AU 场景时,实现了卓越的解剖学忠实性、语义一致性和视觉质量。
引用
@article{arxiv.2603.18588,
title = {A Novel FACS-Aligned Anatomical Text Description Paradigm for Fine-Grained Facial Behavior Synthesis},
author = {Jiahe Wang and Cong Liang and Xuandong Huang and Yuxin Wang and Xin Yun and Yi Wu and Yanan Chang and Shangfei Wang},
journal= {arXiv preprint arXiv:2603.18588},
year = {2026}
}