中文

面向异步语音匿名化的任意-任意说话人属性扰动

声音 2025-08-22 v1

摘要

说话人属性扰动为异步语音匿名化提供了可行方法,通过采用受对抗扰动的语音作为匿名化输出。为了增强来自相同原语音的匿名化语音之间的身份不可链接性,通常会采用针对特定目标说话人的攻击性训练策略,对语音进行匿名化处理。然而,这种策略可能违反指定说话人的隐私。为缓解此风险,本文提出任意-任意训练策略。通过定义批量均值损失,将来自不同说话人的语音在训练小批量中匿名化为常见的伪说话人,伪说话人被近似为小批量中的平均说话人。基于此,提出一种说话人对抗语音生成模型,融合无目标攻击和任意-任意策略的监督。生成说话人属性扰动并纳入原始语音以产生其匿名化版本。通过在 VoxCeleb 数据集上进行实验验证了所提出模型在异步语音匿名化中的有效性。此外,开展了额外实验以探讨说话人对抗语音在语音隐私保护中的潜在局限性。我们旨在为未来研究提供见解,评估其对抗黑盒说话人提取器和适应性攻击的保护效力,以及对外域数据集的泛化性和稳定性。音频样本和开源代码已发布于 https://github.com/VoicePrivacy/any-to-any-speaker-attribute-perturbation。

关键词

引用

@article{arxiv.2508.15565,
  title  = {Any-to-any Speaker Attribute Perturbation for Asynchronous Voice Anonymization},
  author = {Liping Chen and Chenyang Guo and Rui Wang and Kong Aik Lee and Zhenhua Ling},
  journal= {arXiv preprint arXiv:2508.15565},
  year   = {2025}
}