中文

基于声学片段的语音预训练

声音 2022-04-08 v1 音频与语音处理

摘要

以往的语音预训练方法(如 wav2vec2.0 和 HuBERT)通过预测潜在向量量化空间中的元素或通过离线聚类预生成的标签(称为目标码)来预训练 Transformer 编码器,以从音频数据中学习深度表示。然而,这些训练信号(量化元素或码)在不同 token 之间是独立的,未考虑它们之间的关系。根据我们的观察与分析,目标码共享与音素化文本数据对齐的明显模式。基于此,我们提出利用这些模式,在考虑码之间关系的情况下更好地预训练模型。我们提取的模式被称为“声学片段”,取自 HuBERT 码的句子片段结果。以声学片段作为训练信号,我们可以隐式地连接输入音频与自然语言,这有利于音频到文本的任务,如自动语音识别(ASR)。我们的方法“HuBERT-AP”简单而有效,在 LibriSpeech ASR 任务上显著优于强基线。

关键词

引用

@article{arxiv.2204.03240,
  title  = {Speech Pre-training with Acoustic Piece},
  author = {Shuo Ren and Shujie Liu and Yu Wu and Long Zhou and Furu Wei},
  journal= {arXiv preprint arXiv:2204.03240},
  year   = {2022}
}

备注

5 pages, 4 figures; submitted to Interspeech 2022