中文

用于情感模仿强度预测的单模态多任务融合

声音 2024-06-18 v4 人工智能 音频与语音处理

摘要

在本研究中,我们引入了一种评估情感模仿强度(Emotional Mimicry Intensity, EMI)的新方法,作为第六届自然场景情感行为分析研讨会与竞赛的一部分。我们的方法利用在广泛播客数据集上预训练的 Wav2Vec 2.0 架构,以捕获包含语言学和副语言学成分的广泛音频特征。我们通过采用一种将个体特征与全局均值向量相结合的融合技术来优化特征提取过程,从而将更广泛的上下文理解嵌入到我们的分析中。我们方法的一个关键方面是多任务融合策略,该策略不仅利用了这些特征,还结合了预训练的效价-唤醒度-支配度(Valence-Arousal-Dominance, VAD)模型。这种集成旨在通过同时处理多个情感维度来细化情感强度预测,从而在我们的框架中嵌入更丰富的上下文理解。对于音频数据的时序分析,我们的特征融合过程利用了长短期记忆(Long Short-Term Memory, LSTM)网络。这种仅依赖所提供音频数据的方法,相比现有基线表现出显著进步,为自然场景下的情感模仿提供了更全面的理解,并在 EMI 挑战赛中获得了第二名。

关键词

引用

@article{arxiv.2403.11879,
  title  = {Unimodal Multi-Task Fusion for Emotional Mimicry Intensity Prediction},
  author = {Tobias Hallmen and Fabian Deuser and Norbert Oswald and Elisabeth André},
  journal= {arXiv preprint arXiv:2403.11879},
  year   = {2024}
}