AttendAffectNet:基于自注意力网络的电影情感响应预测
声音
2021-10-19 v1 计算机视觉与模式识别
音频与语音处理
摘要
在这项工作中,我们提出了用于电影情感预测的不同变体的基于自注意力网络,称之为AttendAffectNet。我们同时考虑音频和视频,并通过以新颖的方式将自注意力机制应用于提取的特征以进行情感预测,从而纳入多种模态之间的关系。我们将其与典型的基于自注意力模型的时间整合进行比较,在我们的案例中,后者允许在考虑情感响应的顺序依赖性的同时捕获电影时间表示的关联。我们在扩展的COGNIMUSE数据集[1]、[2]和MediaEval 2016电影情感影响任务[3]上证明了我们所提架构的有效性,这些数据集由带有情感标注的电影组成。我们的结果表明,在不同的视听特征上而非时间域上应用自注意力机制对情感预测更为有效。我们的方法也被证明优于许多最先进的情感预测模型。用于复现我们结果及模型实现的代码可在 https://github.com/ivyha010/AttendAffectNet 获取。
引用
@article{arxiv.2010.11188,
title = {AttendAffectNet: Self-Attention based Networks for Predicting Affective Responses from Movies},
author = {Ha Thi Phuong Thao and Balamurali B. T. and Dorien Herremans and Gemma Roig},
journal= {arXiv preprint arXiv:2010.11188},
year = {2021}
}
备注
8 pages, 6 figures