探索结合韵律参数的VQ-VAE用于说话人匿名化
计算机视觉与模式识别
2024-09-25 v1 信号处理
摘要
人类语音传递韵律、语言内容和说话人身份。本文研究了一种新颖的说话人匿名化方法,该方法使用基于矢量量化变分自编码器(VQ-VAE)的端到端网络来处理这些语音成分。该方法旨在解耦这些成分,以专门针对并修改说话人身份,同时保留语言和情感内容。为此,三个独立的分支分别计算内容、韵律和说话人身份的嵌入。在合成过程中,利用这些嵌入,所提出架构的解码器以说话人和韵律信息为条件,从而能够捕捉更细微的情感状态并对说话人识别进行精确调整。研究结果表明,该方法在保留情感信息方面优于大多数基线技术。然而,它在其他语音隐私任务上的表现较为有限,这强调了进一步改进的必要性。
引用
@article{arxiv.2409.15882,
title = {Exploring VQ-VAE with Prosody Parameters for Speaker Anonymization},
author = {Sotheara Leang and Anderson Augusma and Eric Castelli and Frédérique Letué and Sethserey Sam and Dominique Vaufreydaz},
journal= {arXiv preprint arXiv:2409.15882},
year = {2024}
}