基于感知信息损失的语音匿名化语音质量提升
人工智能
2024-10-22 v1 声音
音频与语音处理
摘要
云端语音助手的日益增长使用,使得有效的语音匿名化需求日益紧迫,这旨在隐去说话者身份,同时保留后续任务的关键信息。实现这一目标的一种方法是通过语音转换。虽然现有方法常强调复杂的架构和训练技术,但我们的研究强调以人类听觉系统为灵感的损失函数的重要性。我们提出的损失函数是模型无关的,包含手工特征和深度学习特征,以有效捕捉质量表示。通过客观和主观评估,我们展示了以VQVAE为基础的模型,通过我们的感知驱动损失,在自然度、可理解性和韵律方面均优于基础模型,同时保持说话者匿名性。这些改进在各种数据集、语言、目标说话者和性别上均得到一致验证。
引用
@article{arxiv.2410.15499,
title = {Improving Voice Quality in Speech Anonymization With Just Perception-Informed Losses},
author = {Suhita Ghosh and Tim Thiele and Frederic Lorbeer and Frank Dreyer and Sebastian Stober},
journal= {arXiv preprint arXiv:2410.15499},
year = {2024}
}
备注
Accepted in NeurIPS 2024 Workshop (Audio Imagination)