Light-SERNet:一种用于语音情感识别的轻量全卷积神经网络
音频与语音处理
2021-10-08 v1 信号处理
摘要
直接从语音信号中检测情感在有效的人机交互中起着重要作用。现有的语音情感识别模型需要大量的计算和存储资源,难以在嵌入式系统中与其他机器交互任务并发实现。本文提出一种高效轻量的全卷积神经网络,用于硬件资源受限系统中的语音情感识别。在所提出的FCNN模型中,通过三种不同滤波器尺寸的并行路径提取多种特征图。这有助于深度卷积块提取高层特征,同时保证充分的分离性。提取的特征用于分类输入语音片段的情感。我们的模型尺寸小于最先进(SOTA)模型,却在IEMOCAP和EMO-DB数据集上取得了更高的性能。
引用
@article{arxiv.2110.03435,
title = {Light-SERNet: A lightweight fully convolutional neural network for speech emotion recognition},
author = {Arya Aftab and Alireza Morsali and Shahrokh Ghaemmaghami and Benoit Champagne},
journal= {arXiv preprint arXiv:2110.03435},
year = {2021}
}
备注
ICASSP 2022 submitted, 5 pages, 2 figures, 4 tables