自监督语音表示模型的逐层分析
计算与语言
2022-12-06 v3 机器学习
音频与语音处理
摘要
近来提出的自监督学习方法在预训练语音表示模型方面取得了成功。这些所学表示的效用已在经验上被观察到,但关于预训练表示本身所编码信息的类型或程度则研究甚少。发展此类洞见有助于理解这些模型的能力与局限,并使研究界能更高效地将其用于下游应用。在本工作中,我们通过使用一套分析工具考察一个近期成功且流行的预训练模型(wav2vec 2.0)的中间表示向量,来开始填补这一空白。我们使用典型相关、互信息以及带有非参数探针的简单下游任务性能等度量,以(i)探查声学与语言信息内容,(ii)刻画信息跨模型层的演化,以及(iii)理解为自动语音识别(ASR)微调模型如何影响这些观察。我们的发现促使修改 ASR 的微调协议,从而在低资源设定下产生改进的词错误率。
引用
@article{arxiv.2107.04734,
title = {Layer-wise Analysis of a Self-supervised Speech Representation Model},
author = {Ankita Pasad and Ju-Chieh Chou and Karen Livescu},
journal= {arXiv preprint arXiv:2107.04734},
year = {2022}
}
备注
Accepted to ASRU 2021. Code: https://github.com/ankitapasad/layerwise-analysis