基于时间对齐与感知注意的视听情感识别
计算机视觉与模式识别
2016-03-29 v1 计算与语言
机器学习
摘要
本文关注视频中视听情感识别的两个关键问题。其一是用于特征级融合的音频和视频流时间对齐。其二是定位并重新加权整个视听流中的感知注意以提升识别性能。长短期记忆循环神经网络(LSTM-RNN)被用作主要分类架构。首先,软注意机制对齐音频和视频流。其次,添加与每种分类情感类型对应的七个情感嵌入向量来定位感知注意。定位与重新加权过程同样基于软注意机制。在EmotiW2015数据集上的实验结果和定性分析表明了所提两种技术的有效性。
引用
@article{arxiv.1603.08321,
title = {Audio Visual Emotion Recognition with Temporal Alignment and Perception Attention},
author = {Linlin Chao and Jianhua Tao and Minghao Yang and Ya Li and Zhengqi Wen},
journal= {arXiv preprint arXiv:1603.08321},
year = {2016}
}