中文

用于低延迟语音匿名的端到端流式模型

音频与语音处理 2024-11-04 v2 计算与语言 机器学习

摘要

说话人匿名旨在隐藏说话人身份的线索,同时保留语言内容。当前基于机器学习的方法需要大量的计算资源,阻碍了实时流式应用。为了解决这些问题,我们提出了一种流式模型,能够以低延迟实现说话人匿名。该系统以端到端自编码器的方式训练,使用一个轻量级内容编码器提取类似HuBERT的信息,一个预训练的说话人编码器提取说话人身份,以及一个方差编码器注入音高和能量信息。这三个解耦的表示被馈送到一个解码器,该解码器重新合成语音信号。我们展示了系统两个实现的评估结果:一个完整模型,延迟为230毫秒;以及一个精简版(大小为其0.1倍),进一步将延迟降低到66毫秒,同时在自然度、可懂度和隐私保护方面保持了最先进的性能。

关键词

引用

@article{arxiv.2406.09277,
  title  = {End-to-end streaming model for low-latency speech anonymization},
  author = {Waris Quamer and Ricardo Gutierrez-Osuna},
  journal= {arXiv preprint arXiv:2406.09277},
  year   = {2024}
}