面向野外环境的层次化粒度对齐与状态空间建模:鲁棒多模态AU检测
计算机视觉与模式识别
2026-03-13 v1
摘要
面向野外环境的面部动作单元(AU)检测仍是一个巨大的挑战,due to severe spatial-temporal heterogeneity, unconstrained poses, and complex audio-visual dependencies。虽然最近的多模态方法取得了进展,但它们往往依赖于受限的编码器和浅层融合机制,无法捕捉细粒度语义偏移和超长时序背景。为弥合这一差距,我们提出了一种以层次化粒度对齐和状态空间模型为驱动的新型多模态框架。具体而言,我们利用强大的基础模型(如DINOv2和WavLM)提取稳健且高保真的视觉和音频表征,有效取代传统特征提取器。为处理极端面部变异,我们的层次化粒度对齐模块动态地将全局面部语义与局部活跃 patch 对齐。此外,我们通过引入Vision-Mamba架构来克服常规时序卷积网络的感受野限制。该方法实现了O(N)线性时间复杂度的时序建模,有效捕捉超远时程动态,同时不会出现性能下降。我们还引入一种新的非对称交叉注意力机制,以深入同步语音线索与细微视觉运动。广泛的在Aff-Wild2数据集上的实验表明,我们的方法显著优于现有基线,实现了最新的性能。值得注意的是,该框架在第10届Affective Behavior Analysis in-the-wild竞赛中的AU检测轨道中夺得了第一名。
引用
@article{arxiv.2603.11306,
title = {Hierarchical Granularity Alignment and State Space Modeling for Robust Multimodal AU Detection in the Wild},
author = {Jun Yu and Yunxiang Zhang and Naixiang Zheng and Lingsi Zhu and Guoyuan Wang},
journal= {arXiv preprint arXiv:2603.11306},
year = {2026}
}
备注
8 pages, 1 figures