面向密集情感理解的多粒度模态注意力网络
计算机视觉与模式识别
2021-06-21 v1
摘要
视频情感理解旨在预测视频内容所引发的情绪表达,对于视频创作与推荐具有重要意义。在最近的EEV挑战赛中,提出了密集情感理解任务,要求帧级情感预测。本文提出一种带模态注意力的多粒度网络(MGN-MA),利用多粒度特征更好地描述目标帧。具体而言,多粒度特征可分为帧级、片段级和视频级特征,分别对应视觉显著内容、语义上下文和视频主题信息。随后设计模态注意力融合模块以融合多粒度特征并强化与情感更相关的模态。最后,将融合特征输入专家混合(MOE)分类器预测情绪表达。进一步采用模型集成后处理,所提方法在EEV挑战赛中取得了0.02292的相关性分数。
引用
@article{arxiv.2106.09964,
title = {Multi-Granularity Network with Modal Attention for Dense Affective Understanding},
author = {Baoming Yan and Lin Wang and Ke Gao and Bo Gao and Xiao Liu and Chao Ban and Jiang Yang and Xiaobo Li},
journal= {arXiv preprint arXiv:2106.09964},
year = {2021}
}
备注
Oral presentation at AUVi Workshop - CVPR 2021