中文

面向 AVEC 2017 的连续多模态情感识别方法

计算机视觉与模式识别 2017-10-25 v2 机器学习 多媒体

摘要

本文报告了在第七届音频/视觉情感挑战赛(AVEC 2017)中预测连续情感维度时对音频和视觉特征的分析,该工作作为本科二年级实习项目的一部分完成。对于视觉特征,我们使用了 HOG(方向梯度直方图)特征、基于高斯混合模型(GMM)的 SIFT(尺度不变特征变换)特征 Fisher 编码,以及一些预训练的卷积神经网络层作为特征;所有这些特征均针对每个视频片段提取。对于音频特征,我们使用了由赛事组织者提供的 openXBOW 工具生成的 LLDs(低层描述符)的词袋表示。随后,我们在数据集上针对所有这些不同模态训练了全连接神经网络回归模型。我们对输出模型应用了多模态融合,以获取在开发集和测试集上的一致性相关系数。

关键词

引用

@article{arxiv.1709.05861,
  title  = {Continuous Multimodal Emotion Recognition Approach for AVEC 2017},
  author = {Narotam Singh and Nittin Singh and Abhinav Dhall},
  journal= {arXiv preprint arXiv:1709.05861},
  year   = {2017}
}

备注

4 pages, 3 figures, arXiv:1605.06778, arXiv:1512.03385