面向人脸动作单元检测的层次化视觉-语言交互
计算机视觉与模式识别
2026-02-17 v1
摘要
人脸动作单元 (AU) 检测旨在识别以 FACS (Facial Action Coding System) 定义的细微面部肌肉激活。相对于 AU 检测的一个主要挑战在于,在标注数据有限的条件下有效学习判别性和可泛化的 AU 表示。为此,我们提出一种用于 AU 理解的层次化视觉-语言交互方法 (HiVA),该方法利用文本 AU 描述作为语义先验,以引导和增强 AU 检测。具体而言,HiVA 采用大语言模型生成多样且语境丰富的 AU 描述,以强化基于语言的表示学习。为捕捉细粒度和整体的视觉-语言关联,HiVA 引入了 AU-aware 动态图模块,以促进 AU 特定的视觉表示学习。这些特征进一步集成到由两种互补机制构成的层次化跨模态注意力架构中:解�od 双重跨注意 (DDCA),用于在视觉和文本特征之间建立细粒度、AU 特定的交互;以及情境 双重跨注意 (CDCA),用于建模跨 AU 的全局依赖。这种协作式跨模态学习范式使 HiVA 能够利用多粒度的基于视觉的 AU 特征,以及精炼的基于语言的 AU 细节,最终实现稳健且语义丰富的 AU 检测能力。大量实验表明,HiVA 持续优于当前的 SOTA 方法。此外,定性分析揭示,HiVA 产生语义上有意义的激活模式,凸显其在学习稳健且可解释的跨模态对应关系方面的有效性,以进行全面面部行为分析。
引用
@article{arxiv.2602.14425,
title = {Hierarchical Vision-Language Interaction for Facial Action Unit Detection},
author = {Yong Li and Yi Ren and Yizhe Zhang and Wenhua Zhang and Tianyi Zhang and Muyun Jiang and Guo-Sen Xie and Cuntai Guan},
journal= {arXiv preprint arXiv:2602.14425},
year = {2026}
}
备注
Accepted to IEEE Transaction on Affective Computing 2026