用于语音应用的对比预测编码正则化方法
音频与语音处理
2023-04-27 v2
摘要
对比预测编码(CPC)等自监督方法极大提升了无监督表征的质量。这些表征显著减少了下游任务(如自动语音识别)性能所需的标注数据量。CPC通过给定当前帧预测未来帧来学习表征。基于声学信息(如音素)变化慢于CPC中特征提取速率的观察,我们提出了对特征施加缓慢性约束的正则化技术。在此我们提出两种正则化技术:自表达约束与左或右正则化。我们在ABX和线性音素分类任务、声学单元发现以及自动语音识别上评估所提模型。在100小时无标签数据上训练的正则化CPC达到了在360小时无标签数据上训练的基线CPC的性能。我们还表明我们的正则化技术与数据增强互补,并能进一步提升系统性能。在单语、跨语言或多语设置下,无论是否使用数据增强,无论用于训练的数据量多少,我们的正则化模型在ABX任务上均优于基线CPC模型。
引用
@article{arxiv.2304.05974,
title = {Regularizing Contrastive Predictive Coding for Speech Applications},
author = {Saurabhchand Bhati and Jesús Villalba and Piotr Żelasko and Laureano Moro-Velazquez and Najim Dehak},
journal= {arXiv preprint arXiv:2304.05974},
year = {2023}
}