中文

零样文本语音中面向说话人的投毒框架

声音 2026-03-10 v1 人工智能

摘要

零样文本语音(TTS)语音克隆带来严重的隐私风险,要求从训练好的 TTS 模型中移除特定说话人身份。常规的机器遗忘在此上下文中不够,因为零样 TTS 可仅凭参考提示动态重构语音。我们将此任务形式化为语音生成说话人投毒(SGSP),即修改训练好的模型以防止生成特定身份的语音,同时保持其他说话人的实用性。我们在1个、15个和100个被遗忘说话人上评估了推理时间过滤和参数修改基线。通过WER 和 AUC 以及被遗忘说话人相似度(FSSIM)衡量实用性与隐私之间的权衡。我们在最多15个说话人方面实现了强隐私,但在100个说话人时因身份重叠增加暴露了可扩展性限制。本研究因此引入了一个新问题和评估框架,以推动生成式语音隐私领域的进一步发展。

关键词

引用

@article{arxiv.2603.07551,
  title  = {Targeted Speaker Poisoning Framework in Zero-Shot Text-to-Speech},
  author = {Thanapat Trachu and Thanathai Lertpetchpun and Sai Praneeth Karimireddy and Shrikanth Narayanan},
  journal= {arXiv preprint arXiv:2603.07551},
  year   = {2026}
}

备注

Submitted to Interspeech2026