建模空间与时间线索用于多标签面部动作单元检测
计算机视觉与模式识别
2016-08-03 v1
摘要
面部动作单元(AUs)对于解码人类面部表情至关重要。研究者们专注于使用多种特征与分类器训练AU检测器。然而,若干问题依然存在,即空间表示、时间建模与AU相关性。与大多数分别处理这些问题研究不同,我们提出了一种混合网络架构来联合解决它们。具体而言,空间表示由卷积神经网络(CNN)提取,如本文所分析,其能够减少由手工特征(例如SIFT与Gabor)引起的特定人偏差。为建模时间依赖关系,长短期记忆(LSTM)堆叠于这些表示之上,而不管输入视频的长度。CNN与LSTM的输出进一步聚合成一个融合网络,以产生12个AUs的逐帧预测。我们的网络自然解决了这三个问题,并取得了优于独立考虑这些问题的现有方法的性能。我们在两个大型自发数据集GFT与BP4D上进行了广泛实验,其包含超过400,000帧以12个AUs编码的帧。在这两个数据集上,我们报告了相对于标准多标签CNN和基于特征的最先进方法的显著改进。最后,我们提供了所学AU模型的可视化,据我们所知,其首次揭示了机器如何观察面部AUs。
引用
@article{arxiv.1608.00911,
title = {Modeling Spatial and Temporal Cues for Multi-label Facial Action Unit Detection},
author = {Wen-Sheng Chu and Fernando De la Torre and Jeffrey F. Cohn},
journal= {arXiv preprint arXiv:1608.00911},
year = {2016}
}