基于深度三维特征与序列建模的野外多模态连续效价与唤醒度预测
音频与语音处理
2020-03-02 v1 声音
摘要
野外连续情感预测是一个很有趣且具挑战性的问题,因为连续预测涉及大量计算。本文介绍了我们在 ABAW 竞赛中基于 Aff-Wild2 数据库预测连续情感维度(即效价与唤醒度)所采用的方法与技术。Aff-Wild2 数据库包含在野外采集的视频,并在帧级别标注了效价与唤醒度。我们提出的方法融合了使用最先进方法提取的音频与视频特征(多模态)。这些音视频特征用于训练基于门控循环单元(GRU)的序列到序列模型。我们以简单架构在验证数据上展示了有前景的结果。所提方法的总体效价与唤醒度分别为 0.22 和 0.34,优于竞赛基线 0.14 和 0.24。
引用
@article{arxiv.2002.12766,
title = {Multi-Modal Continuous Valence And Arousal Prediction in the Wild Using Deep 3D Features and Sequence Modeling},
author = {Sowmya Rasipuram and Junaid Hamid Bhat and Anutosh Maitra},
journal= {arXiv preprint arXiv:2002.12766},
year = {2020}
}