中文

Speech Swin-Transformer:探索用于语音情感识别的基于移位窗口的分层 Transformer

计算与语言 2024-01-22 v1

摘要

Swin-Transformer 凭借其基于 Transformer 的分层特征表示,在计算机视觉领域取得了显著成功。在语音信号中,情感信息分布在语音特征的不同尺度上,例如词、短语和话语。受此启发,本文提出了一种具有移位窗口的分层语音 Transformer,用于聚合多尺度情感特征以进行语音情感识别(SER),称为 Speech Swin-Transformer。具体而言,我们首先在时域上将语音频谱图划分为由多个帧块组成的片段级块。然后使用一堆 Swin 块对这些片段级块进行编码,其中利用局部窗口 Transformer 来探索每个片段块内各帧块之间的局部帧间情感信息。之后,我们还设计了一个移位窗口 Transformer,以补偿片段块边界附近的块相关性。最后,我们采用块合并操作,通过将 Transformer 的感受野从帧级扩展到片段级,来聚合片段级情感特征以实现分层语音表示。实验结果表明,我们提出的 Speech Swin-Transformer 优于现有方法。

关键词

引用

@article{arxiv.2401.10536,
  title  = {Speech Swin-Transformer: Exploring a Hierarchical Transformer with Shifted Windows for Speech Emotion Recognition},
  author = {Yong Wang and Cheng Lu and Hailun Lian and Yan Zhao and Björn Schuller and Yuan Zong and Wenming Zheng},
  journal= {arXiv preprint arXiv:2401.10536},
  year   = {2024}
}

备注

Accepted by ICASSP 2024