中文

自监督语音表示模型的逐层分析

计算与语言 2022-12-06 v3 机器学习 音频与语音处理

摘要

近来提出的自监督学习方法在预训练语音表示模型方面取得了成功。这些所学表示的效用已在经验上被观察到,但关于预训练表示本身所编码信息的类型或程度则研究甚少。发展此类洞见有助于理解这些模型的能力与局限,并使研究界能更高效地将其用于下游应用。在本工作中,我们通过使用一套分析工具考察一个近期成功且流行的预训练模型(wav2vec 2.0)的中间表示向量,来开始填补这一空白。我们使用典型相关、互信息以及带有非参数探针的简单下游任务性能等度量,以(i)探查声学与语言信息内容,(ii)刻画信息跨模型层的演化,以及(iii)理解为自动语音识别(ASR)微调模型如何影响这些观察。我们的发现促使修改 ASR 的微调协议,从而在低资源设定下产生改进的词错误率。

关键词

引用

@article{arxiv.2107.04734,
  title  = {Layer-wise Analysis of a Self-supervised Speech Representation Model},
  author = {Ankita Pasad and Ju-Chieh Chou and Karen Livescu},
  journal= {arXiv preprint arXiv:2107.04734},
  year   = {2022}
}

备注

Accepted to ASRU 2021. Code: https://github.com/ankitapasad/layerwise-analysis