从音乐视频中预测情绪:探究视觉与听觉信息对情感反应的相对贡献
计算机视觉与模式识别
2022-02-23 v1 机器学习
多媒体
声音
音频与语音处理
摘要
尽管媒体内容正以越来越多的模态组合被制作、分发和消费,但各单一模态如何对媒体项的感知情绪作出贡献仍知之甚少。在本文中,我们提出 MusicVideos(MuVi),一个用于情感多媒体内容分析的新数据集,以研究听觉与视觉模态如何对媒体的感知情绪作出贡献。数据通过向参与者在三种条件下呈现音乐视频收集:音乐、视觉和视听。参与者随时间对音乐视频的效价和唤醒度进行标注,并标注所传达的整体情绪。我们给出了数据集中关键指标的详细描述性统计以及各条件下特征重要性分析的结果。最后,我们提出一种新颖的迁移学习架构来训练由孤立模态评分增强的预测模型(PAIR),并展示了孤立模态评分在增强多模态情绪识别方面的潜力。我们的结果表明,唤醒度感知主要受听觉信息影响,而效价感知更具主观性,并可能受视觉与听觉信息共同影响。该数据集已公开提供。
引用
@article{arxiv.2202.10453,
title = {Predicting emotion from music videos: exploring the relative contribution of visual and auditory information to affective responses},
author = {Phoebe Chua and Dimos Makris and Dorien Herremans and Gemma Roig and Kat Agres},
journal= {arXiv preprint arXiv:2202.10453},
year = {2022}
}
备注
16 pages with 9 figures