Frame-Level Acoustic Distillation 的 StreamVoiceAnon+:通过保持情感的流式说话人匿名化
音频与语音处理
2026-03-09 v1 人工智能
信号处理
摘要
我们解决了在流式说话人匿名化 (SA) 中保持情感内容的挑战。训练用于音频续期的神经音频编解码器语言模型会降低源情感:内容标记会丢弃情感信息,模型默认遵循主导声学模式,而非保留旁语言属性。我们提出了结合中性情感话语对的监督微调,以及对声学标记隐藏状态进行帧级情感蒸馏的做法。所有修改均限定在微调范围内,该微调在 4 块 GPU 上用时不足 2 小时,且未增加推理延迟开销,同时保持竞争的 180ms 流式延迟。在VoicePrivacy 2024 协议下,我们的方法实现了 49.2% UAR(情感保留)和 5.77% WER(语音清晰度),相较基线提升 24%(39.7%→49.2%),相较情感提示变体提升 10%(44.6%→49.2%),同时保持强大的隐私保护(EER 49.0%)。演示和代码均已公开:https://anonymous3842031239.github.io/。
关键词
引用
@article{arxiv.2603.06079,
title = {StreamVoiceAnon+: Emotion-Preserving Streaming Speaker Anonymization via Frame-Level Acoustic Distillation},
author = {Nikita Kuzmin and Kong Aik Lee and Eng Siong Chng},
journal= {arXiv preprint arXiv:2603.06079},
year = {2026}
}