解耦表示是否为构建说话人匿名化系统所需的一切?
声音
2023-01-16 v3 人工智能
密码学与安全
机器学习
音频与语音处理
摘要
语音信号包含大量敏感信息,如说话人身份,这在语音数据被采集时引发隐私担忧。说话人匿名化旨在转换语音信号以去除源说话人身份,同时保留语音内容不变。当前方法依靠内容/说话人解耦与语音转换来执行转换。通常,自动语音识别系统的声学模型提取内容表示,而 x-vector 系统提取说话人表示。已有工作表明所提取特征并非完美解耦。本文探讨如何改进特征解耦,从而改进转换后的匿名语音。我们提出通过使用向量量化从声学模型中去除说话人信息来增强解耦。使用 VoicePrivacy 2022 工具包的评估表明,向量量化有助于隐藏原始说话人身份,同时保持语音识别的可用性。
引用
@article{arxiv.2208.10497,
title = {Are disentangled representations all you need to build speaker anonymization systems?},
author = {Pierre Champion and Denis Jouvet and Anthony Larcher},
journal= {arXiv preprint arXiv:2208.10497},
year = {2023}
}