中文

用于语音应用的对比预测编码正则化方法

音频与语音处理 2023-04-27 v2

摘要

对比预测编码(CPC)等自监督方法极大提升了无监督表征的质量。这些表征显著减少了下游任务(如自动语音识别)性能所需的标注数据量。CPC通过给定当前帧预测未来帧来学习表征。基于声学信息(如音素)变化慢于CPC中特征提取速率的观察,我们提出了对特征施加缓慢性约束的正则化技术。在此我们提出两种正则化技术:自表达约束与左或右正则化。我们在ABX和线性音素分类任务、声学单元发现以及自动语音识别上评估所提模型。在100小时无标签数据上训练的正则化CPC达到了在360小时无标签数据上训练的基线CPC的性能。我们还表明我们的正则化技术与数据增强互补,并能进一步提升系统性能。在单语、跨语言或多语设置下,无论是否使用数据增强,无论用于训练的数据量多少,我们的正则化模型在ABX任务上均优于基线CPC模型。

关键词

引用

@article{arxiv.2304.05974,
  title  = {Regularizing Contrastive Predictive Coding for Speech Applications},
  author = {Saurabhchand Bhati and Jesús Villalba and Piotr Żelasko and Laureano Moro-Velazquez and Najim Dehak},
  journal= {arXiv preprint arXiv:2304.05974},
  year   = {2023}
}