中文

从小训练集学习音视频情感识别的奥卡姆剃刀视角

人工智能 2018-08-09 v1 计算机视觉与模式识别 神经与进化计算 机器学习

摘要

本文提出一种轻量且准确的深度神经模型用于音视频情感识别。为设计该模型,作者遵循简约哲学,大幅限制从目标数据集学习的参数数量,始终选择最简单的学习方法:i)迁移学习与低维空间嵌入可降维表示。ii)视觉时间信息由简单的逐帧打分选择过程处理,跨时间平均。iii)还提出简单的帧选择机制以对序列图像加权。iv)不同模态的融合在预测层完成(晚期融合)。我们也强调了 AFEW 数据集的固有挑战以及仅用少至 383 个验证序列进行模型选择的困难。所提出的实时情感分类器在 AFEW 测试集上取得了 60.64% 的业界最优准确率,并在 Emotion in the Wild 2018 挑战赛中排名第 4。

关键词

引用

@article{arxiv.1808.02668,
  title  = {An Occam's Razor View on Learning Audiovisual Emotion Recognition with Small Training Sets},
  author = {Valentin Vielzeuf and Corentin Kervadec and Stéphane Pateux and Alexis Lechervy and Frédéric Jurie},
  journal= {arXiv preprint arXiv:1808.02668},
  year   = {2018}
}