用于Odyssey 2024语音情感识别挑战赛的双重多头注意力多模态系统
音频与语音处理
2024-08-06 v1 声音
摘要
随着基于计算机的应用越来越融入我们的日常生活,语音情感识别(SER)的重要性显著增加。为了推动SER领域的创新研究方法,Odyssey 2024语音情感识别挑战赛作为Odyssey 2024说话人与语言识别研讨会的一部分而组织。在本文中,我们描述了为此挑战赛开发的双重多头注意力多模态系统。使用预训练的自监督模型来提取信息丰富的声学和文本特征。采用了一种早期融合策略,其中多头注意力层将这些混合特征转换为互补的上下文表示。然后应用第二个注意力机制将这些表示池化为一个话语级向量。我们提出的系统在分类任务排名中获得了第三名,Macro-F1得分为34.41%,共有31个团队参赛。
引用
@article{arxiv.2406.10598,
title = {Double Multi-Head Attention Multimodal System for Odyssey 2024 Speech Emotion Recognition Challenge},
author = {Federico Costa and Miquel India and Javier Hernando},
journal= {arXiv preprint arXiv:2406.10598},
year = {2024}
}
备注
Odyssey 2024: The Speaker and Language Recognition Workshop