中文

基于离散自监督单元在波形域中的说话风格转换

声音 2023-10-20 v2 计算与语言 机器学习 音频与语音处理

摘要

我们提出 DISSC,一种新颖的轻量级方法,以无文本方式将录音的节奏、音高轮廓和音色转换为目标说话人。与 DISSC 不同,大多数语音转换(VC)方法主要关注音色,而忽略人们独特的说话风格(韵律)。所提出的方法使用预训练的自监督模型将语音编码为离散单元,这使其简单、有效且训练快速。所有转换模块仅在类重建任务上训练,因此适用于任意到多方的无配对数据 VC。我们针对该设置引入了一套定量与定性评估指标,并通过实验证明 DISSC 显著优于所评估的基线方法。代码与样本见 https://pages.cs.huji.ac.il/adiyoss-lab/dissc/。

关键词

引用

@article{arxiv.2212.09730,
  title  = {Speaking Style Conversion in the Waveform Domain Using Discrete Self-Supervised Units},
  author = {Gallil Maimon and Yossi Adi},
  journal= {arXiv preprint arXiv:2212.09730},
  year   = {2023}
}

备注

Accepted at EMNLP 2023