通用语义解缠分隐私-preserving语音表示学习
音频与语音处理
2025-05-21 v2 机器学习
摘要
使用人类语音录音训练大语言模型会引发隐私 concerns,因为这些模型可能生成与训练数据中相应artifact相似的输出。本研究提出了一种通过通用语音编解码器(USC)实现说话人隐私-preserving表示学习的方法。USC 是一种计算效率高的编码-解码模型,通过解缠分语音为:(i) 保留隐私的语义丰富表示,捕捉内容和语音副语言特征,以及(ii) 残余声学和说话人表示,使其能够实现高保真度重建。所做的大量评估表明,USC 的语义表示保留了内容、韵律和情感,同时消除可能可识别的说话人特征。此外,将两种表示组合,USC 实现了语音重建的SOTA。我们还引入了一种用于衡量隐私-preserving性质的评估方法,与感知测试相吻合。我们将 USC 与文献中其他编解码器进行比较,展示了其在隐私-preserving表示学习方面的有效性,说明了说话人匿名化、副语言保留和内容保存在所学语义表示中的权衡。音频样本分享于 https://www.amazon.science/usc-samples。
引用
@article{arxiv.2505.13085,
title = {Universal Semantic Disentangled Privacy-preserving Speech Representation Learning},
author = {Biel Tura Vecino and Subhadeep Maji and Aravind Varier and Antonio Bonafonte and Ivan Valles and Michael Owen and Leif Rädel and Grant Strimel and Seyi Feyisetan and Roberto Barra Chicote and Ariya Rastrow and Constantinos Papayiannis and Volker Leutnant and Trevor Wood},
journal= {arXiv preprint arXiv:2505.13085},
year = {2025}
}
备注
Extended report of the article accepted at Interspeech 2025 (v1)