中文

TVTSyn:面向流式语音转换与匿名化的内容同步时变音高

音频与语音处理 2026-02-11 v1 计算与语言 机器学习 声音

摘要

实时语音转换和说话人匿名化需要在不牺牲语音清晰度和自然度的前提下,实现因果且低延迟的合成。当前系统存在核心表征不匹配:内容是时变的,而说话人身份则作为静态全局嵌入被注入。我们引入一种流式语音合成器,通过内容同步、时变音高(TVT)表征实现身份与内容的时间粒度对齐。全局音高记忆将全局音高实例扩展为多个紧凑 facet;帧级内容注意力访问该记忆,一个门控调节变化,球面插值保持说话人几何结构同时实现平滑局部变化。此外,一个因子化向量量化瓶颈正则化内容以减少残余说话人泄漏。最终系统端到端可流式,GPU 延迟 <80ms。实验表明,与 SOTA 流式基线相比,TVT 在自然度、说话人转换和匿名化方面均实现了提升,确立了 TVT 作为在严格延迟预算下实现隐私保护和表达性语音合成的可扩展方法。

关键词

引用

@article{arxiv.2602.09389,
  title  = {TVTSyn: Content-Synchronous Time-Varying Timbre for Streaming Voice Conversion and Anonymization},
  author = {Waris Quamer and Mu-Ruei Tseng and Ghady Nasrallah and Ricardo Gutierrez-Osuna},
  journal= {arXiv preprint arXiv:2602.09389},
  year   = {2026}
}