时间-频率 Transformer:一种用于语音情感识别的时频联合学习新方法
声音
2023-08-29 v1 音频与语音处理
摘要
本文提出一种用于语音情感识别的时频联合学习新方法,称为时间-频率 Transformer(Time-Frequency Transformer)。其优势在于,时间-频率 Transformer 能够在建模时域和频域内局部情感相关性的同时,挖掘语音信号时频域中的全局情感模式。为此,我们首先设计时间 Transformer 和频率 Transformer,分别捕获帧间和频带内的局部情感模式,以确保时域和频域中情感信息建模的完整性。然后,提出时间-频率 Transformer,通过局部时域和频域情感特征挖掘时频情感关联,以学习更具判别性的全局语音情感表示。整个过程是由一系列 Transformer 模型实现的时频联合学习过程。在 IEMOCAP 和 CASIA 数据库上的实验表明,我们提出的方法优于当前最优(SOTA)方法。
引用
@article{arxiv.2308.14568,
title = {Time-Frequency Transformer: A Novel Time Frequency Joint Learning Method for Speech Emotion Recognition},
author = {Yong Wang and Cheng Lu and Yuan Zong and Hailun Lian and Yan Zhao and Sunan Li},
journal= {arXiv preprint arXiv:2308.14568},
year = {2023}
}
备注
Accepted by International Conference on Neural Information Processing (ICONIP2023)