中文

探索面向表达性多语言语音转换的自监督特征

音频与语音处理 2025-05-14 v1

摘要

语音转换 (VC) 系统广泛用于从 speaker anonymisation 到 personalized speech synthesis 等多个应用。监督方法使用平行数据在不同 speaker 之间学习映射,这种数据昂贵且难以获得。无监督方法通常训练用于重建输入信号,这些信号由 content 和 speaker 信息组成。 disentangling 这些组件是挑战,常常导致 speaker leakage 或情感信息的移除。在本文中,我们探索了通过利用自监督学习 (SSL) 的潜在潜能进行语音转换。将 SSL 模型的潜在表示与 speaker 嵌入拼接后,输入到一个用于重建输入的声码器。零样本语音转换结果表明,这种方法允许保持 source speaker 的情感和 content,同时匹配基于 phonetic posteriorgrams (PPGs) 的 VC 系统的 speaker similarity。

关键词

引用

@article{arxiv.2505.08278,
  title  = {Investigating self-supervised features for expressive, multilingual voice conversion},
  author = {Álvaro Martín-Cortinas and Daniel Sáez-Trigueros and Grzegorz Beringer and Iván Vallés-Pérez and Roberto Barra-Chicote and Biel Tura-Vecino and Adam Gabryś and Piotr Bilinski and Thomas Merritt and Jaime Lorenzo-Trueba},
  journal= {arXiv preprint arXiv:2505.08278},
  year   = {2025}
}

备注

Published as a conference paper at ICASSP 2024