Stream-Voice-Anon:基于神经音频编解码器与语言模型的实时说话人匿名化提升方案
音频与语音处理
2026-02-06 v3 人工智能
摘要
保护说话人身份对于在线语音应用至关重要,但流式说话人匿名化 (SA) 仍属未充分探索的领域。近期研究表明,神经音频编解码器 (NAC) 能提供优越的说话人特征解耦与语言保真度。NAC 还可与因果语言模型 (LM) 结合,用于增强语言保真度和提示控制,以适应流式任务。然而,现有基于 NAC 的在线 LM 系统是为语音转换 (VC) 设计的,缺乏用于隐私保护的技术。基于这些进展,我们提出 Stream-Voice-Anon,通过集成匿名化技术,将现代因果 LM 基于 NAC 的架构专为流式 SA 进行适配。我们的匿名化方法包含伪说话人表示抽样、说话人嵌入混合与多样化提示选择策略,这些策略利用量化内容代码的解耦属性,以防止说话人信息泄露。此外,我们比较了动态延迟与固定延迟配置,以探讨实时场景下的延迟-隐私权衡。在 VoicePrivacy 2024 挑战协议下,Stream-Voice-Anon 相较于前一最先进的流式方法 DarkStream,在情感保持性上实现了显著提升(最高可达 28% 的相对 UAR 提升),同时在可读性上实现了最高可达 46% 的相对 WER 降低,保持可 comparable 的延迟(180ms vs 200ms)和对懒惰信息攻击者的隐私保护,尽管对半信息攻击者表现略有 15% 的相对下降。
引用
@article{arxiv.2601.13948,
title = {Stream-Voice-Anon: Enhancing Utility of Real-Time Speaker Anonymization via Neural Audio Codec and Language Models},
author = {Nikita Kuzmin and Songting Liu and Kong Aik Lee and Eng Siong Chng},
journal= {arXiv preprint arXiv:2601.13948},
year = {2026}
}
备注
Accepted by ICASSP2026. Demo/code: https://paniquex.github.io/Stream-Voice-Anon/