基于音素中间表示的说话人匿名化
声音
2022-07-12 v1 密码学与安全
机器学习
音频与语音处理
摘要
在这项工作中,我们提出了一种说话人匿名化流程,利用高质量自动语音识别与合成系统,生成以音素转写文本和匿名化说话人嵌入为条件的语音。使用音素作为中间表示可确保从输入中近乎完全消除说话人身份信息,同时尽可能保留原始音素内容。我们在LibriSpeech和VCTK语料库上的实验揭示了两个关键发现:1)尽管自动语音识别产生不完美的转写,我们的神经语音合成系统能够处理此类错误,使我们的系统可行且鲁棒;2)结合来自不同资源的说话人嵌入是有益的,且其适当归一化至关重要。总体而言,我们最终的最佳系统在抵御懒惰知情攻击者的隐私鲁棒性方面显著优于Voice Privacy Challenge 2020提供的基线,同时保持匿名化语音的高可懂度与自然度。
引用
@article{arxiv.2207.04834,
title = {Speaker Anonymization with Phonetic Intermediate Representations},
author = {Sarina Meyer and Florian Lux and Pavel Denisov and Julia Koch and Pascal Tilli and Ngoc Thang Vu},
journal= {arXiv preprint arXiv:2207.04834},
year = {2022}
}
备注
Accepted at Interspeech 2022