IDMap:基于说话人身份索引到向量映射的伪说话人生成框架
音频与语音处理
2025-12-04 v3
摘要
借助于将语音解耦为内容、说话人和韵律的语音生成框架,语音匿名化通过用伪说话人的嵌入向量替换原始说话人嵌入向量来实现。在此框架中,伪说话人的生成构成了一个基本挑战。当前的伪说话人生成方法在伪说话人的唯一性方面表现出局限性,从而限制了其在语音隐私保护中的有效性。此外,现有的基于模型的方法存在计算成本高的问题。特别是在需要生成大量伪说话人的大规模场景中,唯一性不足和计算效率低下的局限性变得更加显著。为此,本文提出了一个伪说话人生成框架,该框架在前馈架构中建立了从说话人身份索引到说话人向量的映射,称为IDMap。具体来说,该框架被具体化为两个模型:IDMap-MLP和IDMap-Diff。在小型和大型评估数据集上进行了实验。在LibriSpeech数据集上的小规模评估验证了所提出的IDMap框架在增强伪说话人唯一性方面的有效性,从而以更低的计算成本改善了语音隐私保护。在MLS和Common Voice数据集上的大规模评估进一步证明了IDMap框架在随着伪说话人数量增加时语音隐私保护能力稳定性方面的优越性。音频样本和开源代码可在https://github.com/VoicePrivacy/IDMap获取。
引用
@article{arxiv.2511.06246,
title = {IDMap: A Pseudo-Speaker Generator Framework Based on Speaker Identity Index to Vector Mapping},
author = {Zeyan Liu and Liping Chen and Kong Aik Lee and Zhenhua Ling},
journal= {arXiv preprint arXiv:2511.06246},
year = {2025}
}
备注
This work has been submitted to the IEEE for possible publication