用于低延迟语音匿名的端到端流式模型
音频与语音处理
2024-11-04 v2 计算与语言
机器学习
摘要
说话人匿名旨在隐藏说话人身份的线索,同时保留语言内容。当前基于机器学习的方法需要大量的计算资源,阻碍了实时流式应用。为了解决这些问题,我们提出了一种流式模型,能够以低延迟实现说话人匿名。该系统以端到端自编码器的方式训练,使用一个轻量级内容编码器提取类似HuBERT的信息,一个预训练的说话人编码器提取说话人身份,以及一个方差编码器注入音高和能量信息。这三个解耦的表示被馈送到一个解码器,该解码器重新合成语音信号。我们展示了系统两个实现的评估结果:一个完整模型,延迟为230毫秒;以及一个精简版(大小为其0.1倍),进一步将延迟降低到66毫秒,同时在自然度、可懂度和隐私保护方面保持了最先进的性能。
引用
@article{arxiv.2406.09277,
title = {End-to-end streaming model for low-latency speech anonymization},
author = {Waris Quamer and Ricardo Gutierrez-Osuna},
journal= {arXiv preprint arXiv:2406.09277},
year = {2024}
}