FV2ES:一种用于快速且高效视频情感识别推理的全端到端多模态系统
计算机视觉与模式识别
2022-09-22 v1
摘要
在最新的社交网络中,越来越多的人倾向于通过文本、语音和丰富的面部表情在视频中表达情感。多模态视频情感分析技术可基于图像中的人体表情与姿态、语音中的语调以及识别出的自然语言,自动理解用户的内心世界。然而,在现有研究中,与视觉和文本模态相比,声学模态长期处于边缘地位。也就是说,提升声学模态对整个多模态情感识别任务的贡献往往更为困难。此外,尽管引入常见深度学习方法可获得更好性能,但这些训练模型的复杂结构总会导致推理效率低下,尤其在处理高分辨率、长时长视频时。而且,缺乏一个全端到端的多模态视频情感识别系统阻碍了其应用。本文设计了一个全多模态视频到情感系统(命名为FV2ES)用于快速且高效的识别推理,其优势有三:(1) 在声谱上采用分层注意力方法突破了声学模态贡献有限的问题,并在IEMOCAP和CMU-MOSEI数据集上均优于现有模型性能;(2) 引入多尺度视觉提取而单分支推理的思想,在带来更高效率的同时保持了预测精度;(3) 将数据预处理进一步集成到对齐的多模态学习模型中,显著降低了计算成本与存储空间。
引用
@article{arxiv.2209.10170,
title = {FV2ES: A Fully End2End Multimodal System for Fast Yet Effective Video Emotion Recognition Inference},
author = {Qinglan Wei and Xuling Huang and Yuan Zhang},
journal= {arXiv preprint arXiv:2209.10170},
year = {2022}
}