中文

利用自监督预训练声学与语言特征进行连续语音情感识别

计算与语言 2020-11-19 v1

摘要

用于特征提取的预训练是一种日益受到关注的方法,用以获取音频与文本内容的更优连续表示。在本工作中,我们使用 wav2vec 与 camemBERT 作为自监督学习模型来表示数据,以便在 AlloSat(一个描述满意度维度的法语大型情感数据库)以及 SOTA 语料 SEWA(聚焦效价、唤醒与喜好维度)上执行连续语音情感识别(SER)。据我们所知,本文首次表明联合使用 wav2vec 与类 BERT 预训练特征非常有助于应对连续 SER 任务,该任务通常以标注训练数据量小为特征。以公认的 concordance correlation coefficient(CCC,一致性相关系数)评估,我们的实验显示,在 AlloSat 数据集上可达到 0.825 的 CCC 值,而使用 MFCC 结合 word2vec 词嵌入时仅为 0.592。

关键词

引用

@article{arxiv.2011.09212,
  title  = {On the use of Self-supervised Pre-trained Acoustic and Linguistic Features for Continuous Speech Emotion Recognition},
  author = {Manon Macary and Marie Tahon and Yannick Estève and Anthony Rousseau},
  journal= {arXiv preprint arXiv:2011.09212},
  year   = {2020}
}

备注

Accepted in IEEE SLT 2021