中文

Audio ALBERT:一种用于音频表征自监督学习的轻量 BERT

音频与语音处理 2021-05-04 v5 计算与语言 声音

摘要

对于自监督语音处理,使用预训练模型作为语音表征提取器至关重要。在近期工作中,为获得更好性能,声学模型训练采用了增大模型规模的方法。本文中,我们提出 Audio ALBERT,一种自监督语音表征模型的轻量版本。我们将所得表征用于说话人识别与音素分类两个下游任务。我们表明,Audio ALBERT 在以少 91% 参数的情况下,能够在下游任务中取得与那些大型模型相竞争的性能。此外,我们使用一些简单探测模型来衡量说话人与音素信息在隐表征中的编码程度。在探测实验中,我们发现隐表征比最后一层编码了更丰富的音素与说话人信息。

关键词

引用

@article{arxiv.2005.08575,
  title  = {Audio ALBERT: A Lite BERT for Self-supervised Learning of Audio Representation},
  author = {Po-Han Chi and Pei-Hung Chung and Tsung-Han Wu and Chun-Cheng Hsieh and Yen-Hao Chen and Shang-Wen Li and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2005.08575},
  year   = {2021}
}

备注

Accepted by IEEE Spoken Language Technology Workshop 2021