基于解耦的说话人匿名化系统为何无法保持情感?
音频与语音处理
2025-01-23 v1 声音
摘要
基于解耦的说话人匿名化涉及将语音分解为语义有意义的表示,改变说话人嵌入,并使用神经声码器重新合成波形。已知此类最先进系统会去除情感信息。可能的原因包括基于 GAN 的声码器中的模式崩溃、通过说话人嵌入对情感的意外建模与修改,或对中间表示的过度清洗。本文对一个最先进的说话人匿名化系统进行了全面评估,以理解其潜在原因。我们得出结论,主要原因是中间表示中缺乏与情感相关的信息。如果说话人嵌入是在生成式上下文中学习的,则它们也具有很大影响。声码器的分布外性能影响较小。此外,我们发现合成伪影会增加谱峰度,使情感识别评估偏向于将话语分类为愤怒。因此,我们得出结论,仅报告情感识别性能的无权重平均召回率是次优的。
引用
@article{arxiv.2501.13000,
title = {Why disentanglement-based speaker anonymization systems fail at preserving emotions?},
author = {Ünal Ege Gaznepoglu and Nils Peters},
journal= {arXiv preprint arXiv:2501.13000},
year = {2025}
}
备注
5 pages, accepted to ICASSP 2025