Speaker VGG CCT:结合说话人嵌入与视觉 Transformer 的跨语料语音情感识别
声音
2022-11-07 v1 计算机视觉与模式识别
音频与语音处理
摘要
近年来,语音情感识别(SER)的研究主要将语音信号转换为谱图,随后使用在通用图像上预训练并用谱图微调的卷积神经网络进行分类。本文从上述总体思路出发,开发了一种基于紧凑卷积 Transformer(CCT)结合说话人嵌入的 SER 新学习方案。借助 CCT,视觉 Transformer(ViT)的学习能力得以与因卷积而减少对大量数据量的需求相结合。这在 SER 中十分重要,因为通常无法获得大型数据语料。说话人嵌入使网络能够提取说话人的身份表示,随后通过自注意力机制与 CCT 从谱图中提取的特征相融合。总体而言,该方案能够实时运行,在训练与测试数据集相互独立的跨语料场景下展现出有前景的结果。实验在文献中少用的跨语料设定下于多个基准上进行,所得结果可与最先进网络架构持平或优于后者。我们的代码见 https://github.com/JabuMlDev/Speaker-VGG-CCT。
引用
@article{arxiv.2211.02366,
title = {SPEAKER VGG CCT: Cross-corpus Speech Emotion Recognition with Speaker Embedding and Vision Transformers},
author = {A. Arezzo and S. Berretti},
journal= {arXiv preprint arXiv:2211.02366},
year = {2022}
}