中文

Frame-Level Acoustic Distillation 的 StreamVoiceAnon+:通过保持情感的流式说话人匿名化

音频与语音处理 2026-03-09 v1 人工智能 信号处理

摘要

我们解决了在流式说话人匿名化 (SA) 中保持情感内容的挑战。训练用于音频续期的神经音频编解码器语言模型会降低源情感:内容标记会丢弃情感信息,模型默认遵循主导声学模式,而非保留旁语言属性。我们提出了结合中性情感话语对的监督微调,以及对声学标记隐藏状态进行帧级情感蒸馏的做法。所有修改均限定在微调范围内,该微调在 4 块 GPU 上用时不足 2 小时,且未增加推理延迟开销,同时保持竞争的 180ms 流式延迟。在VoicePrivacy 2024 协议下,我们的方法实现了 49.2% UAR(情感保留)和 5.77% WER(语音清晰度),相较基线提升 24%(39.7%→49.2%),相较情感提示变体提升 10%(44.6%→49.2%),同时保持强大的隐私保护(EER 49.0%)。演示和代码均已公开:https://anonymous3842031239.github.io/。

关键词

引用

@article{arxiv.2603.06079,
  title  = {StreamVoiceAnon+: Emotion-Preserving Streaming Speaker Anonymization via Frame-Level Acoustic Distillation},
  author = {Nikita Kuzmin and Kong Aik Lee and Eng Siong Chng},
  journal= {arXiv preprint arXiv:2603.06079},
  year   = {2026}
}