中文

用于维度视听情感识别的多任务学习与多阶段融合

音频与语音处理 2022-07-22 v2

摘要

由于其利用多模态特征准确预测情绪状态的能力,视听情感识别近来获得了研究者更多的关注。本文提出两种方法,利用多任务学习和融合策略从音频与视觉数据预测情感属性。首先,通过为每个属性调整三个参数来采用多任务学习以提高识别率。其次,提出一种多阶段融合,以结合来自各模态最终预测的結果。我们所采用的多任务学习应用于单模态和早期融合方法,相比单任务学习有所提升,平均 CCC 得分为 0.431 对比 0.297。一种应用于晚期融合方法的多阶段方法,在数据的开发集上显著提升了真实值与预测值之间的一致性得分(对于唤醒度、效价和喜好度,从 [0.537, 0.565, 0.083] 提升至 [0.68, 0.656, 0.443])。

关键词

引用

@article{arxiv.2002.11312,
  title  = {Multitask Learning and Multistage Fusion for Dimensional Audiovisual Emotion Recognition},
  author = {Bagus Tris Atmaja and Masato Akagi},
  journal= {arXiv preprint arXiv:2002.11312},
  year   = {2022}
}

备注

3 figures, 3 tables, accepted at ICASSP 2020