中文

用于语音音频信号情感识别的多时间尺度卷积

音频与语音处理 2020-03-10 v1 机器学习 声音 机器学习

摘要

针对语音音频的情感识别,对时间变化的鲁棒性十分重要,因为情感是通过复杂的频谱模式表达的,这些模式会根据说话人和语境在时间轴上表现出显著的局部扩张与压缩。为解决此问题并潜在地服务于其他任务,我们提出了多时间尺度(MTS)方法,在分析音频数据的时频表示时,对时间变化提供灵活性。MTS 以沿时间轴缩放并重采样的卷积核扩展卷积神经网络,从而在不增加可训练参数数量(相较于标准卷积层)的情况下提升时间灵活性。我们使用 4 个不同规模的数据集,在不同架构下评估了 MTS 与标准卷积层在语音音频情感识别中的表现。结果表明,与标准卷积相比,MTS 层的使用持续改善了不同容量与深度网络的泛化能力,尤其在较小数据集上。

关键词

引用

@article{arxiv.2003.03375,
  title  = {Multi-Time-Scale Convolution for Emotion Recognition from Speech Audio Signals},
  author = {Eric Guizzo and Tillman Weyde and Jack Barnett Leveson},
  journal= {arXiv preprint arXiv:2003.03375},
  year   = {2020}
}