基于神经音频编解码语言模型的说话人匿名化
音频与语音处理
2024-01-15 v3 声音
摘要
绝大多数说话人匿名化方法涉及提取基频估计、语言特征和说话人嵌入,在利用声码器重新合成匿名语音波形之前,对该嵌入进行扰动以混淆说话人身份。近期研究表明,x-vector变换难以一致地控制:基频和语言特征中包含的其他说话人信息在声码化过程中重新纠缠,意味着匿名语音信号仍包含说话人信息。我们提出一种基于神经音频编解码(NACs)的方法,已知NACs与语言模型结合可生成高质量合成语音。NACs使用量化码,已知其能有效瓶颈化说话人相关信息:我们通过应用Voice Privacy Challenge 2022的评估框架,展示了基于NAC语言建模的说话人匿名化系统的潜力。
引用
@article{arxiv.2309.14129,
title = {Speaker anonymization using neural audio codec language models},
author = {Michele Panariello and Francesco Nespoli and Massimiliano Todisco and Nicholas Evans},
journal= {arXiv preprint arXiv:2309.14129},
year = {2024}
}
备注
Accepted at ICASSP 2024