中文

基于深度学习的 F0 合成用于说话人匿名化

音频与语音处理 2023-06-30 v1

摘要

用于说话人匿名化的语音转换是一种新兴的隐私保护概念。在深度学习框架下,这通过从语音中提取多种特征、改变说话人身份并进行波形合成来实现。然而,许多现有系统不修改基频(F0)轨迹,而 F0 承载韵律信息并可能泄露说话人身份。此外,F0 与其他特征的不匹配会降低语音质量与可懂度。本文正式提出一种由其他语音特征合成 F0 轨迹的方法,并评估其重建能力。随后我们在说话人匿名化框架中测试该方法,将其与基线及一种利用说话人信息的先进 F0 修改方法比较。结果表明,我们的方法在说话人匿名性(以等错误率衡量)与可用性(以词错误率衡量)上均有提升。

关键词

引用

@article{arxiv.2306.16860,
  title  = {Deep Learning-based F0 Synthesis for Speaker Anonymization},
  author = {Ünal Ege Gaznepoglu and Nils Peters},
  journal= {arXiv preprint arXiv:2306.16860},
  year   = {2023}
}

备注

5 pages, 4 figures, 6 tables, accepted to EUSIPCO 2023