基于结构语义映射的面部动作单元和表情的双向学习
计算机视觉与模式识别
2026-04-21 v2
摘要
面部动作单元(AU)检测和面部表情(FE)识别可以统一视为情感面部行为任务,分别代表细粒度的肌肉激活和粗粒度的整体情感状态。尽管二者在语义上存在关联,现有研究主要聚焦于从 AU 向 FE 的知识传递,而忽略了双向学习。实际应用中,这一挑战又因数据异构性问题加剧:AU 和 FE 数据集在标注范式(帧级 vs. 剪辑级)、标签粒度和数据可得性与多样性方面存在差异,阻碍了有效的联合学习。为此,我们提出一种结构语义映射(SSM)框架,用于在不同数据域和异构监督条件下的双向 AU-FE 学习。SSM 包含三个关键组件:(1)一个共享视觉主干网络,从动态 AU 和 FE 视频中学习统一的面部表征;(2)通过文本语义原型(TSP)模块构建结构化语义原型,这些原型来自固定的文本描述 augmented with 可学习的上下文提示,作为监督信号和跨任务对齐锚点置于共享语义空间中;(3)动态先验映射(DPM)模块融合面部动作编码系统(FACS)中的先验知识,并在高层特征空间中学习数据驱动的关联矩阵,实现显式的双向知识传递。广泛的实验表明,SSM 在两个任务上均实现了同步的 state-of-the-art 性能,并证明即使在异构数据集上,整体表情语义也能增强细粒度 AU 学习。
引用
@article{arxiv.2604.10541,
title = {Bidirectional Learning of Facial Action Units and Expressions via Structured Semantic Mapping across Heterogeneous Datasets},
author = {Jia Li and Yu Zhang and Yin Chen and Zhenzhen Hu and Yong Li and Richang Hong and Shiguang Shan and Meng Wang},
journal= {arXiv preprint arXiv:2604.10541},
year = {2026}
}
备注
The source code and models will be publicly available at https://github.com/MSA-LMC/SSM