中文

用于语音情感识别的深度散射网络

音频与语音处理 2021-05-12 v1 机器学习 声音 信号处理

摘要

本文引入散射变换用于语音情感识别(SER)。散射变换生成的特征表示对时间和频率上的形变与平移保持稳定,且信息损失很小。在语音中,情感线索分布于时间上并定位于频率中。散射系数的时间与频率不变性特征提供了一种对情感无关变化(例如不同说话人、语言、性别等)具有鲁棒性、同时保留由情感线索引起的变化的表示。因此,这种表示能更高效地从语音中捕获情感信息。我们进行了实验,在不同数据库上比较散射系数与标准梅尔频率倒谱系数(MFCCs)。观察到频率散射优于时域散射和 MFCCs。我们还研究了分层散射系数,以分析对 SER 而言时移与形变稳定的 scalogram 和调制谱系数的重要性。我们观察到独立取用的分层系数也优于 MFCCs。

关键词

引用

@article{arxiv.2105.04806,
  title  = {Deep scattering network for speech emotion recognition},
  author = {Premjeet Singh and Goutam Saha and Md Sahidullah},
  journal= {arXiv preprint arXiv:2105.04806},
  year   = {2021}
}

备注

5 pages, 4 figures, Accepted for publication in 2021 European Signal Processing Conference (EUSIPCO 2021)