自监督语音表征在匿名化声音的同时保留语音特征
计算与语言
2022-04-05 v1
摘要
收集语音数据是训练语音识别系统及其他基于语音的机器学习模型的重要步骤。然而,隐私保护问题日益受到关注,必须加以解决。本研究探讨使用语音转换作为匿名化声音的方法。具体而言,我们使用包括 Wav2Vec2.0、Hubert 和 UniSpeech 在内的自监督语音表征训练了若干语音转换模型。转换后的声音保持了低于原始声音 1% 的词错误率。在 LibriSpeech 测试集上等错误率从 1.52% 升至 46.24%,在来自 VCTK 语料库的说话人上从 3.75% 升至 45.84%,这表明说话人验证性能下降。最后,我们在构音障碍语音数据上进行实验,表明可从匿名化声音中提取与发音、韵律、发声和音系相关的语音特征,以区分健康与病理语音。
引用
@article{arxiv.2204.01677,
title = {Self-Supervised Speech Representations Preserve Speech Characteristics while Anonymizing Voices},
author = {Abner Hernandez and Paula Andrea Pérez-Toro and Juan Camilo Vásquez-Correa and Juan Rafael Orozco-Arroyave and Andreas Maier and Seung Hee Yang},
journal= {arXiv preprint arXiv:2204.01677},
year = {2022}
}
备注
Submitted for review at Interspeech 2022