中文

面向隐私保护的端到端全双工语音对话模型

音频与语音处理 2026-03-10 v1 人工智能 信号处理

摘要

端到端全双工语音模型会将用户音频通过始终运行的大型语言模型(LLM)主干,但关于其隐藏表示中对说话人隐私的影响尚未进行探讨。遵循VoicePrivacy 2024协议,并采用懒惰式攻击者,我们展示了SALM-Duplex和Moshi的隐藏状态在所有变换层中都会泄露大量说话人身份信息。层级和轮次分析揭示,泄露在所有层中都持续存在,SALM-Duplex在早期层显示更强的泄露,而Moshi则在各层均匀泄露,且可链接性在前几轮中显著上升。我们提出了两种基于Stream-Voice-Anon的流式匿名化方案:一种是波形级别的前端(Anon-W2W),另一种是特征域替换(Anon-W2F)。Anon-W2F将离散编码基线(11.2%)的错误识别率(EER)提高了3.5倍以上,达到41.0%,接近50%的随机猜测上限,而Anon-W2W在各种设置下保留了78%-93%的基线sBERT性能,响应延迟小于1秒(FRL小于0.8秒)。

关键词

引用

@article{arxiv.2603.08179,
  title  = {Privacy-Preserving End-to-End Full-Duplex Speech Dialogue Models},
  author = {Nikita Kuzmin and Tao Zhong and Jiajun Deng and Yingke Zhu and Tristan Tsoi and Tianxiang Cao and Simon Lui and Kong Aik Lee and Eng Siong Chng},
  journal= {arXiv preprint arXiv:2603.08179},
  year   = {2026}
}