中文

面向三维卷积神经网络的时序随机 Softmax:在面部表情识别中的应用

计算机视觉与模式识别 2020-11-11 v1 机器学习

摘要

训练深度学习模型以在视频中准确进行面部表情的时空识别需要大量计算资源。出于实际原因,三维卷积神经网络(3D CNNs)通常使用从视频中随机提取的较短片段进行训练。然而,这种均匀采样一般是次优的,因为对每个时序片段赋予了同等重要性。本文提出了一种用于 3D CNNs 基于视频高效训练的策略。它依赖于 softmax 时序池化和加权采样机制来选择最相关的训练片段。所提 softmax 策略具有若干优势:由于高效的片段采样而降低了计算复杂度,并且由于时序加权在训练和推理阶段均聚焦于更相关的片段而提高了准确率。在多个面部表情识别基准上使用所提方法获得的实验结果展示了聚焦训练视频中信息更丰富片段的益处。具体而言,我们的方法通过减小视频不精确裁剪与粗标注以及视觉信息跨时间异构分布的影响,改善了性能并降低了计算成本。

关键词

引用

@article{arxiv.2011.05227,
  title  = {Temporal Stochastic Softmax for 3D CNNs: An Application in Facial Expression Recognition},
  author = {Théo Ayral and Marco Pedersoli and Simon Bacon and Eric Granger},
  journal= {arXiv preprint arXiv:2011.05227},
  year   = {2020}
}

备注

Accepted to WACV 2021