中文

基于Sinc卷积的原始音频多模态情感识别

声音 2024-02-20 v1 多媒体 音频与语音处理

摘要

语音情感识别(SER)对计算机来说仍然是一项复杂的任务,在最真实的数据集上平均召回率通常约为70%。大多数SER系统使用从音频信号中提取的手工特征,如能量、过零率、频谱信息、韵律、梅尔频率倒谱系数(MFCC)等。最近,使用原始波形训练神经网络正成为一种新兴趋势。这种方法具有优势,因为它消除了特征提取流程。从时域信号学习已在语音识别、说话人验证等任务中显示出良好结果。在本文中,我们利用Sinc卷积层(一种用于预处理原始语音波形进行情感识别的高效架构)从原始音频信号中提取声学特征,随后使用长短期记忆(LSTM)网络。我们还整合了语言特征,并附加了对话情感解码(DED)策略。我们的方法在交互式情感二元运动捕捉(IEMOCAP)数据集上的四类情感识别中达到了85.1%的加权准确率。

关键词

引用

@article{arxiv.2402.11954,
  title  = {Multimodal Emotion Recognition from Raw Audio with Sinc-convolution},
  author = {Xiaohui Zhang and Wenjie Fu and Mangui Liang},
  journal= {arXiv preprint arXiv:2402.11954},
  year   = {2024}
}