中文

EigenEmo:基于动态模式分解的谱话语表示用于语音情感分类

音频与语音处理 2020-08-18 v1 声音

摘要

人类情感语音本质上是一种变异信号。这导致了基于语音的自动情感分类所固有的动态性。在本工作中,我们探索了一种源自流体动力学的谱分解方法,即动态模式分解(DMD),以计算性地表示和分析情感语音的全局话语级动态。具体而言,首先通过情感蒸馏过程学习片段级情感特定表示。这为每个话语形成了称为情感轮廓(EPs)的多维情感流信号。然后将 DMD 算法应用于所得 EPs 以捕获本征频率,从而捕获情感流的基本转移动态。使用我们称之为 EigenEmo 的所提方法的评估实验显示出有前景的结果。此外,由于其互补性质的正向结合,将 EigenEmo 生成的话语表示与简单 EPs 平均相拼接产生了显著的增益。

关键词

引用

@article{arxiv.2008.06665,
  title  = {EigenEmo: Spectral Utterance Representation Using Dynamic Mode Decomposition for Speech Emotion Classification},
  author = {Shuiyang Mao and P. C. Ching and Tan Lee},
  journal= {arXiv preprint arXiv:2008.06665},
  year   = {2020}
}