用于面部表情视频年龄估计的注意力端到端架构
计算机视觉与模式识别
2019-12-03 v2 多媒体
摘要
从面部表情视频进行年龄估计的主要挑战不仅在于静态面部外观的建模,还在于时间面部动态的捕捉。针对该问题的传统技术侧重于构建手工特征,分别挖掘面部外观与动态中所包含的判别信息。这依赖于精细的特征提炼与框架设计。本文提出一种用于年龄估计的端到端架构,称为空间索引注意力模型(SIAM),它能够从面部表情原始视频中同时学习年龄的外观与动态。具体而言,我们采用卷积神经网络提取有效的潜在外观表示,并将其输入循环网络以建模时间动态。更重要的是,我们提出利用注意力模型在单幅图像的空间域以及整段视频的时间域中进行显著性检测。我们在卷积层之间设计了一种特定的空间索引注意力机制,以提取每幅独立图像中的显著面部区域,并设计时间注意力层为每一帧分配注意力权重。这种双管齐下的方法不仅通过使模型聚焦于信息丰富的帧与面部区域而提升了性能,还提供了空间面部区域、时间帧与年龄估计任务之间的可解释对应关系。我们在一个大型、性别均衡的数据库(包含400名受试者,年龄跨度为8至76岁)上的实验中展示了模型的强劲性能。实验表明,在充足训练数据下,我们的模型相比最先进的方法具有显著优越性。
引用
@article{arxiv.1711.08690,
title = {Attended End-to-end Architecture for Age Estimation from Facial Expression Videos},
author = {Wenjie Pei and Hamdi Dibeklioğlu and Tadas Baltrušaitis and David M. J. Tax},
journal= {arXiv preprint arXiv:1711.08690},
year = {2019}
}
备注
Accepted by Transactions on Image Processing (TIP)