中文

推动无监督单元发现用于 SSL 语音表征的极限

计算与语言 2023-06-16 v1 声音 音频与语音处理

摘要

自监督学习 (SSL) 在语音基础模型上出色的泛化能力引起了显著关注。HuBERT 是一个成功范例,其利用离线聚类将语音特征转换为离散单元以进行掩码语言建模代理任务。然而,简单地通过 k-means 聚类特征作为目标并不能充分激发模型性能。在本工作中,我们提出一种无监督方法来改进 SSL 目标。提出了两种模型 MonoBERT 和 PolyBERT,它们利用与上下文无关和与上下文相关的基于音素的单元进行预训练。我们的模型在 LibriSpeech 基准上显著优于其他 SSL 模型,且无需迭代重聚类与重训练。此外,配备上下文相关单元的我们的模型甚至优于在预训练期间使用标注数据的目标改进模型。我们如何通过实验逐步改进单元发现过程得到了展示。

关键词

引用

@article{arxiv.2306.08920,
  title  = {Pushing the Limits of Unsupervised Unit Discovery for SSL Speech Representation},
  author = {Ziyang Ma and Zhisheng Zheng and Guanrou Yang and Yu Wang and Chao Zhang and Xie Chen},
  journal= {arXiv preprint arXiv:2306.08920},
  year   = {2023}
}

备注

Accepted to Interspeech 2023