基于Sinc卷积的原始音频多模态情感识别
声音
2024-02-20 v1 多媒体
音频与语音处理
摘要
语音情感识别(SER)对计算机来说仍然是一项复杂的任务,在最真实的数据集上平均召回率通常约为70%。大多数SER系统使用从音频信号中提取的手工特征,如能量、过零率、频谱信息、韵律、梅尔频率倒谱系数(MFCC)等。最近,使用原始波形训练神经网络正成为一种新兴趋势。这种方法具有优势,因为它消除了特征提取流程。从时域信号学习已在语音识别、说话人验证等任务中显示出良好结果。在本文中,我们利用Sinc卷积层(一种用于预处理原始语音波形进行情感识别的高效架构)从原始音频信号中提取声学特征,随后使用长短期记忆(LSTM)网络。我们还整合了语言特征,并附加了对话情感解码(DED)策略。我们的方法在交互式情感二元运动捕捉(IEMOCAP)数据集上的四类情感识别中达到了85.1%的加权准确率。
引用
@article{arxiv.2402.11954,
title = {Multimodal Emotion Recognition from Raw Audio with Sinc-convolution},
author = {Xiaohui Zhang and Wenjie Fu and Mangui Liang},
journal= {arXiv preprint arXiv:2402.11954},
year = {2024}
}