中文

基于分段对比预测编码的无监督语音分割与变速率表征学习

音频与语音处理 2021-10-12 v2 声音

摘要

通常,将语音无监督分割为音素及类词单元被视为独立任务,且常通过未充分利用二者相互依赖性的不同方法完成。在此,我们将其统一,提出一种可联合执行两项任务的技术,表明它们确实相互受益。近期尝试采用自监督学习,如对比预测编码(CPC),根据过去上下文预测下一帧。然而,CPC 仅关注音频信号的帧级结构。我们以分段对比预测编码(SCPC)框架克服该局限,在更高层次(如音素级)对信号结构建模。卷积神经网络通过噪声对比估计(NCE)从原始波形学习帧级表征。可微边界检测器寻找变长分段,随后用于通过 NCE 优化分段编码器以学习分段表征。可微边界检测器使我们能联合训练帧级与分段级编码器。实验表明,我们的单一模型在 TIMIT 与 Buckeye 数据集上优于现有音素与词语分割方法。我们发现音素类别影响边界检测性能,且连续元音或半元音间的边界最难识别。最后,我们使用 SCPC 在分段级而非均匀间隔帧级(如 10 ms)提取语音特征,并生成随话语内容变化的变速率表征。我们能将特征提取率从典型的 100 Hz 降至平均低至 14.5 Hz,同时在线性音素分类任务上仍优于 MFCC 特征。

关键词

引用

@article{arxiv.2110.02345,
  title  = {Unsupervised Speech Segmentation and Variable Rate Representation Learning using Segmental Contrastive Predictive Coding},
  author = {Saurabhchand Bhati and Jesús Villalba and Piotr Żelasko and Laureano Moro-Velazquez and Najim Dehak},
  journal= {arXiv preprint arXiv:2110.02345},
  year   = {2021}
}

备注

arXiv admin note: substantial text overlap with arXiv:2106.02170