在声音被听见之前擦除你的声音:面向零样本文本到语音的训练-free说话人遗忘
音频与语音处理
2026-01-29 v1 声音
摘要
现代零样本文本到语音(TTS)模型提供了前所未有的表达能力,但也带来了严重的犯罪风险,因为它们可以合成从未获得同意的个人的语音。在此背景下,说话人遗忘旨在请求时防止生成特定的说话人身份。现有方法依赖于重新训练,成本高昂且仅限于训练集中看到的说话人。我们提出了一种训练-free说话人遗忘框架,称为 TruS,颠覆了从数据删除转向推理时控制的范式。TruS 通过引导特定于身份的隐藏激活来抑制目标说话人,同时保持其他属性(如韵律和情感)。实验结果表明,TruS 有效地防止了在看到的和未看到的 opt-out 说话人上生成语音,建立了一个可扩展的语音合成安全措施。演示和代码均可在 http://mmai.ewha.ac.kr/trus 提供。
引用
@article{arxiv.2601.20481,
title = {Erasing Your Voice Before It's Heard: Training-free Speaker Unlearning for Zero-shot Text-to-Speech},
author = {Myungjin Lee and Eunji Shin and Jiyoung Lee},
journal= {arXiv preprint arXiv:2601.20481},
year = {2026}
}
备注
ICASSP'2026