减、重用、回收:扰动数据是否优于其他语言增强用于低资源自监督语音模型
音频与语音处理
2024-07-02 v2 计算与语言
声音
摘要
自监督表征学习(SSRL)在音素识别等任务上已展现优于监督模型的性能。训练SSRL模型对低资源语言构成挑战,因其可能缺乏充足预训练数据。常见方法是跨语言预训练。相反,我们提出使用音频增强技术,即:音高变化、加噪、带口音目标语言与他语言语音,在低资源条件下预训练SSRL模型并评估音素识别。我们的比较发现,合成增强(噪声/音高)组合策略优于口音与语言知识迁移。此外,我们考察了增强数据的缩放因子,以达成与使用目标域语音预训练模型相当的性能。我们的结果表明,对资源受限语言,组合增强可成为优于其他增强的可行选项。
引用
@article{arxiv.2309.12763,
title = {Reduce, Reuse, Recycle: Is Perturbed Data better than Other Language augmentation for Low Resource Self-Supervised Speech Models},
author = {Asad Ullah and Alessandro Ragano and Andrew Hines},
journal= {arXiv preprint arXiv:2309.12763},
year = {2024}
}
备注
Paper accepted in Interspeech2024