中文

基于无监督语音重构解耦韵律表征

声音 2023-09-27 v2 计算与语言 音频与语音处理

摘要

人类语音可由不同成分表征,包括语义内容、说话人身份与韵律信息。在自动语音识别(ASR)与说话人验证任务中,语义内容与说话人身份的解耦表征已取得显著进展。然而,由于不同属性(如音色与节奏)的内在关联,以及为实现鲁棒的大规模且与说话人无关的 ASR 需要监督训练方案,提取韵律信息仍是一个开放且具有挑战性的研究问题。本文旨在基于无监督重构解决从语音中解耦情感韵律的问题。具体而言,我们在提出的语音重构模型 Prosody2Vec 中识别、设计、实现并整合了三个关键组件:(1)将语音信号转换为离散语义内容单元的单元编码器;(2)生成说话人身份嵌入的预训练说话人验证模型;(3)用于学习韵律表征的可训练韵律编码器。我们首先在无标注情感语音语料库上预训练 Prosody2Vec 表征,随后在特定数据集上微调模型以执行语音情感识别(SER)与情感语音转换(EVC)任务。EVC 任务上的客观(加权与未加权准确率)与主观(平均意见得分)评测均表明,Prosody2Vec 有效捕获了可平滑迁移至其他情感语音的通用韵律特征。此外,我们在 IEMOCAP 数据集上的 SER 实验显示,Prosody2Vec 学习到的韵律特征具有互补性,有益于广泛使用的语音预训练模型性能,且在 Prosody2Vec 与 HuBERT 表征结合时超越了 SOTA 方法。

关键词

引用

@article{arxiv.2212.06972,
  title  = {Disentangling Prosody Representations with Unsupervised Speech Reconstruction},
  author = {Leyuan Qu and Taihao Li and Cornelius Weber and Theresa Pekarek-Rosin and Fuji Ren and Stefan Wermter},
  journal= {arXiv preprint arXiv:2212.06972},
  year   = {2023}
}

备注

Accepted by IEEE/ACM Transactions on Audio, Speech, and Language Processing