MUSA:基于串联解耦的多语言说话人匿名化
音频与语音处理
2024-07-17 v1
摘要
说话人匿名化是一种有效的隐私保护解决方案,旨在隐藏说话人的身份,同时保留原始语音的语言内容和副语言信息。虽然大多数先前研究仅关注单一语言,但理想的说话人匿名化系统应能够处理多种语言。本文提出了 MUSA(Multi-lingual Speaker Anonymization),一种采用串联解耦策略的多语言说话人匿名化方法,通过逐步从全局时不变表示到时变表示进行解耦。利用语义蒸馏和自监督说话人蒸馏,串联解耦策略可避免强归纳偏置,并在不同语言之间表现出优异的泛化性能。同时,本文提出一种简洁的匿名化策略,采用全零值空嵌入来模拟说话人身份隐蔽过程,从而消除将说话人身份转换为伪说话人身份的需求,从而降低了说话人匿名化过程的复杂性。在 VoicePrivacy 官方数据集和多语言数据集上的实验结果表明,MUSA 能够有效保护说话人隐私,同时保留语言内容和副语言信息。
引用
@article{arxiv.2407.11629,
title = {MUSA: Multi-lingual Speaker Anonymization via Serial Disentanglement},
author = {Jixun Yao and Qing Wang and Pengcheng Guo and Ziqian Ning and Yuguang Yang and Yu Pan and Lei Xie},
journal= {arXiv preprint arXiv:2407.11629},
year = {2024}
}
备注
Submitted to TASLP