中文

emotion2vec:用于语音情感表示的自监督预训练

计算与语言 2023-12-27 v1 人机交互 多媒体 声音 音频与语音处理

摘要

我们提出emotion2vec,一个通用语音情感表示模型。emotion2vec通过自监督在线蒸馏在开源无标签情感数据上预训练,在预训练中结合了话语级损失和帧级损失。emotion2vec在主流IEMOCAP数据集上仅训练线性层进行语音情感识别任务,就超越了最先进的预训练通用模型和情感专家模型。此外,emotion2vec在10种不同语言的语音情感识别数据集上表现出一致的提升。emotion2vec还在其他情感任务上表现出色,如歌曲情感识别、对话情感预测和情感分析。对比实验、消融实验和可视化全面展示了所提出的emotion2vec的通用能力。据我们所知,emotion2vec是首个在各种情感相关任务中的通用表示模型,填补了该领域的空白。

关键词

引用

@article{arxiv.2312.15185,
  title  = {emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation},
  author = {Ziyang Ma and Zhisheng Zheng and Jiaxin Ye and Jinchao Li and Zhifu Gao and Shiliang Zhang and Xie Chen},
  journal= {arXiv preprint arXiv:2312.15185},
  year   = {2023}
}

备注

Code, checkpoints, and extracted features are available at https://github.com/ddlBoJack/emotion2vec