从小训练集学习音视频情感识别的奥卡姆剃刀视角
人工智能
2018-08-09 v1 计算机视觉与模式识别
神经与进化计算
机器学习
摘要
本文提出一种轻量且准确的深度神经模型用于音视频情感识别。为设计该模型,作者遵循简约哲学,大幅限制从目标数据集学习的参数数量,始终选择最简单的学习方法:i)迁移学习与低维空间嵌入可降维表示。ii)视觉时间信息由简单的逐帧打分选择过程处理,跨时间平均。iii)还提出简单的帧选择机制以对序列图像加权。iv)不同模态的融合在预测层完成(晚期融合)。我们也强调了 AFEW 数据集的固有挑战以及仅用少至 383 个验证序列进行模型选择的困难。所提出的实时情感分类器在 AFEW 测试集上取得了 60.64% 的业界最优准确率,并在 Emotion in the Wild 2018 挑战赛中排名第 4。
引用
@article{arxiv.1808.02668,
title = {An Occam's Razor View on Learning Audiovisual Emotion Recognition with Small Training Sets},
author = {Valentin Vielzeuf and Corentin Kervadec and Stéphane Pateux and Alexis Lechervy and Frédéric Jurie},
journal= {arXiv preprint arXiv:1808.02668},
year = {2018}
}