用于维度情感预测的多模态条件注意力融合
计算机视觉与模式识别
2017-09-08 v1 机器学习
多媒体
摘要
连续维度情感预测是一项具有挑战性的任务,其中多种模态的融合通常能取得最先进的性能,例如早期融合或晚期融合。本文提出一种名为条件注意力融合的新型多模态融合策略,其可在每个时间步动态关注不同模态。长短期记忆循环神经网络(LSTM-RNN)被用作基础单模态模型以捕捉长时间依赖。分配给不同模态的权重由当前输入特征和近期历史信息自动决定,而非在任何情况下固定不变。我们在基准数据集 AVEC2015 上的实验结果表明了该方法的有效性,其在效价预测上优于几种常见融合策略。
引用
@article{arxiv.1709.02251,
title = {Multi-modal Conditional Attention Fusion for Dimensional Emotion Prediction},
author = {Shizhe Chen and Qin Jin},
journal= {arXiv preprint arXiv:1709.02251},
year = {2017}
}
备注
Appeared at ACM Multimedia 2016