中文

用于维度情感预测的多模态条件注意力融合

计算机视觉与模式识别 2017-09-08 v1 机器学习 多媒体

摘要

连续维度情感预测是一项具有挑战性的任务,其中多种模态的融合通常能取得最先进的性能,例如早期融合或晚期融合。本文提出一种名为条件注意力融合的新型多模态融合策略,其可在每个时间步动态关注不同模态。长短期记忆循环神经网络(LSTM-RNN)被用作基础单模态模型以捕捉长时间依赖。分配给不同模态的权重由当前输入特征和近期历史信息自动决定,而非在任何情况下固定不变。我们在基准数据集 AVEC2015 上的实验结果表明了该方法的有效性,其在效价预测上优于几种常见融合策略。

关键词

引用

@article{arxiv.1709.02251,
  title  = {Multi-modal Conditional Attention Fusion for Dimensional Emotion Prediction},
  author = {Shizhe Chen and Qin Jin},
  journal= {arXiv preprint arXiv:1709.02251},
  year   = {2017}
}

备注

Appeared at ACM Multimedia 2016