用于维度视听情感识别的多任务学习与多阶段融合
音频与语音处理
2022-07-22 v2
摘要
由于其利用多模态特征准确预测情绪状态的能力,视听情感识别近来获得了研究者更多的关注。本文提出两种方法,利用多任务学习和融合策略从音频与视觉数据预测情感属性。首先,通过为每个属性调整三个参数来采用多任务学习以提高识别率。其次,提出一种多阶段融合,以结合来自各模态最终预测的結果。我们所采用的多任务学习应用于单模态和早期融合方法,相比单任务学习有所提升,平均 CCC 得分为 0.431 对比 0.297。一种应用于晚期融合方法的多阶段方法,在数据的开发集上显著提升了真实值与预测值之间的一致性得分(对于唤醒度、效价和喜好度,从 [0.537, 0.565, 0.083] 提升至 [0.68, 0.656, 0.443])。
引用
@article{arxiv.2002.11312,
title = {Multitask Learning and Multistage Fusion for Dimensional Audiovisual Emotion Recognition},
author = {Bagus Tris Atmaja and Masato Akagi},
journal= {arXiv preprint arXiv:2002.11312},
year = {2022}
}
备注
3 figures, 3 tables, accepted at ICASSP 2020