中文

作为无监督声学词嵌入输入特征的自监督语音表征比较

计算与语言 2020-12-15 v1 音频与语音处理

摘要

许多语音处理任务涉及度量语音片段之间的声学相似度。声学词嵌入(AWE)通过将任意时长的语音片段映射到固定维向量,从而实现高效比较。对于以无标注语音为唯一可用资源的零资源语音处理,一些最佳的AWE方法依赖于以自动发现的类词片段形式提供的弱自顶向下约束。另一条零资源研究路线不是在片段层面学习嵌入,而是关注短时帧层面的表征学习。近期方法包括自监督预测编码与对应自编码器(CAE)模型。在本文中,我们考察这些帧级特征用作无监督AWE模型训练输入时是否有益。我们将来自对比预测编码(CPC)、自回归预测编码和CAE的帧级特征与传统的MFCC进行比较。这些特征被用作基于循环CAE的AWE模型的输入。在英文与Xitsonga数据的词辨别任务中,三种表征学习方法均优于MFCC,其中CPC始终表现出最大的提升。在跨语言实验中,我们发现英文上训练的CPC特征也可迁移至Xitsonga。

关键词

引用

@article{arxiv.2012.07387,
  title  = {A comparison of self-supervised speech representations as input features for unsupervised acoustic word embeddings},
  author = {Lisa van Staden and Herman Kamper},
  journal= {arXiv preprint arXiv:2012.07387},
  year   = {2020}
}

备注

Accepted to SLT 2021