中文

不要模仿我的声音:面向零样本文本语音合成的说话人身份遗忘

声音 2025-07-29 v1 人工智能 音频与语音处理

摘要

零样本文本语音合成(Zero-Shot Text-to-Speech, ZS-TTS)技术的快速发展,使我们能够仅凭最少的音频线索即可实现高保真语音合成,引发了显著的隐私与伦理争议。尽管语音隐私受到威胁,但针对从预训练模型参数中选择性地删除复制不希望个体声线知识的研究尚未探索。本文针对 ZS-TTS 系统的说话人身份遗忘这一新挑战,提出了首个机器遗忘框架,尤其是 Teacher-Guided Unlearning(TGU),旨在确保模型遗忘指定的说话人身份,同时保留其为其他说话人生成准确语音的能力。我们提出的方法引入随机性,以防止一致地复制被遗忘说话人的声线,确保遗忘的身份无法被追溯。此外,我们提出了新的评估指标 speaker-Zero Retrain Forgetting(spk-ZRF),用于评估模型是否会忽略与被遗忘说话人相关的提示,从而有效中和其对这些声线的知识。在最新模型上的实验表明,TGU 能防止模型复制被遗忘说话人的声线,同时保持其他说话人的高质量语音生成。演示地址为 https://speechunlearn.github.io/。

关键词

引用

@article{arxiv.2507.20140,
  title  = {Do Not Mimic My Voice: Speaker Identity Unlearning for Zero-Shot Text-to-Speech},
  author = {Taesoo Kim and Jinju Kim and Dongchan Kim and Jong Hwan Ko and Gyeong-Moon Park},
  journal= {arXiv preprint arXiv:2507.20140},
  year   = {2025}
}

备注

Proceedings of the 42nd International Conference on Machine Learning (ICML 2025), Vancouver, Canada. PMLR 267, 2025. Authors Jinju Kim and Taesoo Kim contributed equally