中文

利用无监督说话风格迁移改进语音情感识别

声音 2023-12-29 v3 人工智能 音频与语音处理

摘要

人类可以轻松修改各种韵律属性(如重音位置和情感强度)以传达特定情绪,同时保持一致的语义内容。受此能力启发,我们提出 EmoAug,一种新颖的风格迁移模型,旨在增强情感表达并解决语音情感识别任务中的数据稀缺问题。EmoAug 由一个语义编码器和一个副语言编码器组成,分别表征言语和非言语信息。此外,解码器通过以前述两条信息流为条件,以无监督方式重建语音信号。训练完成后,EmoAug 通过将不同风格输入副语言编码器,以不同韵律属性(如重音、节奏和强度)丰富情感语音的表达。EmoAug 还能为每个类别生成相近数量的样本,从而解决数据不平衡问题。在 IEMOCAP 数据集上的实验结果表明,EmoAug 能成功迁移不同说话风格,同时保留说话人身份和语义内容。此外,我们用 EmoAug 增强的数据训练了一个 SER 模型,结果显示该增强模型不仅超越了最先进的监督和自监督方法,还克服了由数据不平衡引起的过拟合问题。部分音频样本可在我们的演示网站上找到。

关键词

引用

@article{arxiv.2211.08843,
  title  = {Improving Speech Emotion Recognition with Unsupervised Speaking Style Transfer},
  author = {Leyuan Qu and Wei Wang and Cornelius Weber and Pengcheng Yue and Taihao Li and Stefan Wermter},
  journal= {arXiv preprint arXiv:2211.08843},
  year   = {2023}
}

备注

Accepted by ICASSP2024