用于语音情感识别的矢量量化掩码自编码器
声音
2023-04-24 v1 机器学习
音频与语音处理
摘要
近年来,得益于深度学习技术的进展,语音情感识别(SER)取得了显著进步。然而,标记数据的有限可用性仍是该领域的一大挑战。自监督学习近期已成为应对此挑战的一种有前景的方案。在本文中,我们提出用于语音的矢量量化掩码自编码器(VQ-MAE-S),一种经微调以从语音信号识别情感的自监督模型。VQ-MAE-S 模型基于在矢量量化变分自编码器的离散潜空间上运作的掩码自编码器(MAE)。实验结果表明,所提出的 VQ-MAE-S 模型在 VoxCeleb2 数据集上预训练并在情感语音数据上微调后,优于在原始频谱图表征上运作的 MAE 及 SER 中其他最先进方法。
引用
@article{arxiv.2304.11117,
title = {A vector quantized masked autoencoder for speech emotion recognition},
author = {Samir Sadok and Simon Leglaive and Renaud Séguier},
journal= {arXiv preprint arXiv:2304.11117},
year = {2023}
}
备注
https://samsad35.github.io/VQ-MAE-Speech/