中文

基于视频掩码自编码器的知识引导动作单元检测:AU-vMAE

计算机视觉与模式识别 2024-07-17 v1

摘要

当前的人脸动作单元 (FAU) 检测方法通常因标注视频训练数据的稀缺和面部 ID 数量有限的限制,导致训练得到的特征提取器难以覆盖人脸结构和运动的大多样性。为显式解决上述挑战,我们提出一种新颖的视频级预训练方案,充分探索 FAU 在视频中的多标签特性以及时序标签一致性。我们的设计核心是基于视频掩码自编码器预训练的视频特征提取器,搭配一个在微调阶段联合完成多级视频 FAU 分析任务的网络,即整合视频级和帧级 FAU 检测,从而将稀疏 FAU 标注扩展到所有视频帧(包括被掩码帧)的监督范围。此外,我们利用帧间和帧内 AU 配对状态矩阵作为先验知识来指导网络训练,而非传统的图神经网络,以获得更好的时序监督。我们的方法在现有的 BP4D 和 DISFA FAU 数据集上显著优于现有的领先方法。

关键词

引用

@article{arxiv.2407.11468,
  title  = {AU-vMAE: Knowledge-Guide Action Units Detection via Video Masked Autoencoder},
  author = {Qiaoqiao Jin and Rui Shi and Yishun Dou and Bingbing Ni},
  journal= {arXiv preprint arXiv:2407.11468},
  year   = {2024}
}