中文

ContentVec:一种通过解耦说话人实现改进的语音自监督表示

声音 2022-06-27 v2 人工智能 音频与语音处理

摘要

语音中的自监督学习涉及在大规模无标注语音语料库上训练语音表示网络,然后将学到的表示应用于下游任务。由于语音自监督学习的大多数下游任务主要关注语音中的内容信息,最理想的语音表示应能将说话人变化等不期望的变异从内容中解耦出来。然而,解耦说话人非常具有挑战性,因为去除说话人信息很容易同时导致内容损失,而后者的损害通常远大于前者的收益。本文提出一种新的自监督学习方法,可在不严重损失内容的情况下实现说话人解耦。我们的方法改编自 HuBERT 框架,并引入解耦机制来正则化教师标签与所学表示。我们在一组内容相关的下游任务上评估了说话人解耦的益处,观察到我们的说话人解耦表示具有一致且显著的性能优势。

关键词

引用

@article{arxiv.2204.09224,
  title  = {ContentVec: An Improved Self-Supervised Speech Representation by Disentangling Speakers},
  author = {Kaizhi Qian and Yang Zhang and Heting Gao and Junrui Ni and Cheng-I Lai and David Cox and Mark Hasegawa-Johnson and Shiyu Chang},
  journal= {arXiv preprint arXiv:2204.09224},
  year   = {2022}
}