DarkStream:低延迟的实时语音匿名化
音频与语音处理
2025-09-08 v1 计算与语言
机器学习
摘要
我们提出了 DarkStream,一个用于实时说话人匿名化的流式语音合成模型。为了在严格的延迟约束下改进内容编码,DarkStream 结合了因果波形编码器、短前瞻缓冲区以及基于 Transformer 的上下文层。为了进一步减少推理时间,该模型直接通过神经声码器生成波形,从而去除了中间的梅尔频谱图转换。最后,DarkStream 通过将 GAN 生成的伪说话人嵌入注入来自内容编码器的语言特征来实现说话人身份匿名化。评估表明,我们的模型实现了强大的匿名化效果,在惰性知情攻击场景下产生了接近 50% 的说话人确认等错误率(接近随机猜测性能),同时保持了可接受的语言可懂度(WER 在 9% 以内)。通过平衡低延迟、稳健的隐私保护和最小的可懂度下降,DarkStream 为保护隐私的实时语音通信提供了一种实用的解决方案。
引用
@article{arxiv.2509.04667,
title = {DarkStream: real-time speech anonymization with low latency},
author = {Waris Quamer and Ricardo Gutierrez-Osuna},
journal= {arXiv preprint arXiv:2509.04667},
year = {2025}
}
备注
Accepted for presentation at ASRU 2025