释放基础模型在隐私增强语音理解中的潜力:基于标签引导合成语音内容的低资源语音训练早期研究
声音
2023-06-14 v1 音频与语音处理
摘要
自动语音理解(ASU)利用深度学习模型的强大能力来准确解读人类语音,从而催生了丰富人类体验的广泛语音应用。然而,训练一个鲁棒的 ASU 模型需要整理大量语音样本,这带来了隐私泄露风险。在这项工作中,我们研究使用基础模型来辅助隐私增强语音计算。与主要关注数据扰动或分布式算法的传统工作不同,我们的工作研究了使用预训练生成模型,仅凭标签引导来合成语音内容作为训练数据的可能性。我们表明,使用训练标签引导的合成语音内容进行零样本学习仍是一项具有挑战性的任务。另一方面,我们的结果表明,用合成语音样本训练的模型为低资源 ASU 训练提供了一个有效的初始化点。这一结果揭示了通过减少用户数据收集但使用标签引导合成语音内容来增强隐私的潜力。
引用
@article{arxiv.2306.07791,
title = {Unlocking Foundation Models for Privacy-Enhancing Speech Understanding: An Early Study on Low Resource Speech Training Leveraging Label-guided Synthetic Speech Content},
author = {Tiantian Feng and Digbalay Bose and Xuan Shi and Shrikanth Narayanan},
journal= {arXiv preprint arXiv:2306.07791},
year = {2023}
}