用于预测电影所引发情感反应的多模态深度模型
计算机视觉与模式识别
2019-09-18 v2
摘要
本研究的目标是开发并分析用于预测观众观看电影片段时所体验情感反应的多模态模型。我们基于片段的视频与音频开发混合多模态预测模型。对于视频内容,我们假设图像内容与运动均为引发情绪预测的关键特征。为捕获此类信息,我们使用预训练神经网络从 RGB 帧与光流中提取特征。对于音频模型,我们计算一组增强的低层描述子,包括强度、响度、倒谱、线性预测系数、音高与嗓音质量。视觉与音频特征随后拼接以创建音视频特征,用于预测引发的情感。为将电影片段分类至相应情感反应类别,我们提出两种基于深度神经网络模型的方法。第一种基于无时间组件记忆的全连接层,第二种通过长短期记忆循环神经网络(LSTM)纳入时序依赖。我们对各特征集的重要性进行了透彻分析。实验揭示,在我们的设置中,独立预测各时间步情感比使用 LSTM 的准确率略高。有趣的是,我们还观察到视频中光流比 RGB 更具信息量,且总体而言,在最终预测引发情感时,使用音频特征的模型比基于视频特征的模型更准确。
引用
@article{arxiv.1909.06957,
title = {Multimodal Deep Models for Predicting Affective Responses Evoked by Movies},
author = {Ha Thi Phuong Thao and Dorien Herremans and Gemma Roig},
journal= {arXiv preprint arXiv:1909.06957},
year = {2019}
}
备注
10 pages, 7 figures, Preprint accepted for publication in the Proceedings of the 2nd International Workshop on Computer Vision for Physiological Measurement as part of ICCV. Seoul, South Korea. 2019