重编程基于自监督学习的语音表征用于说话人匿名化
音频与语音处理
2023-11-20 v1
摘要
当前的说话人匿名化方法,尤其是基于自监督学习(SSL)模型的方法,在隐藏说话人身份时需要大量计算资源。本文提出一种基于近期端到端模型重编程技术的有效且参数高效的说话人匿名化方法。为提升匿名化性能,我们首先从大型 SSL 模型中提取说话人表征作为说话人标识。为隐藏说话人身份,我们通过将说话人适配到伪域来重编程该说话人表征。在 VoicePrivacy Challenge(VPC)2022 数据集上进行了大量实验,以证明我们提出的参数高效学习匿名化方法的有效性。此外,在取得与 VPC 2022 强基线 1.b 相当性能的同时,我们的方法在匿名化过程中消耗更少的计算资源。
引用
@article{arxiv.2311.10664,
title = {Reprogramming Self-supervised Learning-based Speech Representations for Speaker Anonymization},
author = {Xiaojiao Chen and Sheng Li and Jiyi Li and Hao Huang and Yang Cao and Liang He},
journal= {arXiv preprint arXiv:2311.10664},
year = {2023}
}
备注
accepted in ACM Multimedia Asia2023