面向野外环境的更优西班牙语情感识别:深层光谱语音分析
声音
2024-09-10 v1 计算与语言
计算机视觉与模式识别
音频与语音处理
摘要
在创建新的社会助理机器人背景下,情感识别已成为关键开发因素,因为它使机器人能够适应用户在野外的情感状态。本文聚焦于两个西班牙语语音数据集的分析:ELRA-S0329 和 EmoMatchSpanishDB。具体聚焦于副语言学,即与信息内容一起的声学特征。我们提出使用 DeepSpectrum 方法,该方法包括提取音频轨迹的视觉表示并将其输入到预训练的 CNN 模型中。对于分类任务,DeepSpectrum 常与支持向量分类器 --DS-SVC-- 或全连接深度学习分类器 --DS-FC-- 配对使用。我们比较了 DS-SVC 和 DS-FC 架构与 ELRA-S0329 和 EmoMatchSpanishDB 的最新方法 (SOTA) 的结果。此外,我们提出了基于注意力机制的自有分类器,即 DS-AM。我们对所有模型都在两个数据集上进行了训练,发现我们的 DS-AM 模型在数据集和最新 DeepSpectrum 架构方面均优于 SOTA 模型。最后,我们在一个数据集上训练 DS-AM 模型,在另一个数据集上进行测试,以模拟模型对数据集偏差的程度。
关键词
引用
@article{arxiv.2409.05148,
title = {Better Spanish Emotion Recognition In-the-wild: Bringing Attention to Deep Spectrum Voice Analysis},
author = {Elena Ortega-Beltrán and Josep Cabacas-Maso and Ismael Benito-Altamirano and Carles Ventura},
journal= {arXiv preprint arXiv:2409.05148},
year = {2024}
}