中文

基于 BAVED 数据集采用 Wav2vec2.0 与 HuBERT 的阿拉伯语语音情感识别

计算机视觉与模式识别 2021-10-12 v1 人工智能 机器学习

摘要

近来,语音识别与自然语言处理领域取得了大量研究成果。这得益于发展良好的多层深度学习范式,如 wav2vec2.0、Wav2vecU、WavBERT 与 HuBERT,它们提供了更好的表示学习与高信息捕获能力。此类范式先在数百未标注数据上运行,再于小规模数据集上微调以完成特定任务。本文提出一种构建于深度学习的阿拉伯语语音对话情感识别模型。所开发模型采用了最先进的音频表示,包括 wav2vec2.0 与 HuBERT。我们模型的实验与性能结果超越了此前已知的成果。

关键词

引用

@article{arxiv.2110.04425,
  title  = {Arabic Speech Emotion Recognition Employing Wav2vec2.0 and HuBERT Based on BAVED Dataset},
  author = {Omar Mohamed and Salah A. Aly},
  journal= {arXiv preprint arXiv:2110.04425},
  year   = {2021}
}

备注

6 pages, 6 figures