中文

面向语音情感识别的多尺度时序 Transformer

音频与语音处理 2024-10-02 v1

摘要

语音情感识别在人机交互系统中发挥着关键作用。最近 various 优化的 Transformer 已成功应用于语音情感识别。然而,现有的 Transformer 架构更关注全局信息,计算需求大。另一方面,语音情感表示在输入语音的不同部分上存在丰富的局部信息。为解决这些问题,我们提出了用于语音情感识别的多尺度时序 Transformer (MSTR)。它包含三个主要组成部分:(1) 多尺度时序特征算子,(2) 分形自注意力模块,和 (3)尺度混合模块。这三个组件能够有效增强 Transformer 学习多尺度局部情感表示的能力。实验结果表明,所提出的 MSTR 模型在三个语音情感数据集 IEMOCAP、MELD 和 CREMAD 上显著优于 vanilla Transformer 和其他最新方法。此外,它还能大大降低计算成本。

关键词

引用

@article{arxiv.2410.00390,
  title  = {Multi-Scale Temporal Transformer For Speech Emotion Recognition},
  author = {Zhipeng Li and Xiaofen Xing and Yuanbo Fang and Weibin Zhang and Hengsheng Fan and Xiangmin Xu},
  journal= {arXiv preprint arXiv:2410.00390},
  year   = {2024}
}