用于语音语句级信息抽取的非对比自监督学习
音频与语音处理
2022-08-11 v1 人工智能
机器学习
摘要
在近期研究中,自监督预训练模型在迁移学习中往往优于监督预训练模型。特别地,语句级语音表征的自监督学习(SSL)可用于需要语句内一致属性(说话人、语言、情感与年龄)判别性表征的语音应用。现有帧级自监督语音表征(如 wav2vec)可通过池化用作语句级表征,但模型通常庞大。亦有学习语句级表征的 SSL 技术,其中最成功之一为对比方法,其需负采样:选取替代样本与当前样本(锚点)对比。然而,若无标签,这无法确保所有负样本均属不同于锚点类的类别。本文应用非对比自监督方法学习语句级嵌入。我们将计算机视觉中的无标签蒸馏(DINO)适配至语音。与对比方法不同,DINO 无需负采样。我们将 DINO 与以监督方式训练的 x-vector 比较,在迁移至下游任务(说话人验证、语音情感识别(SER)与阿尔茨海默病检测)时,DINO 优于 x-vector。我们研究了迁移学习中若干方面的影响,如将微调过程分步、块长度或数据增强。微调时,先调最后仿射层再调整个网络胜过一次性全调。使用更短块长度虽生成更多样输入,却未必提升性能,意味着各应用需至少特定长度语音段以获更好性能。增强在 SER 中有助益。
引用
@article{arxiv.2208.05445,
title = {Non-Contrastive Self-supervised Learning for Utterance-Level Information Extraction from Speech},
author = {Jaejin Cho and Jes'us Villalba and Laureano Moro-Velazquez and Najim Dehak},
journal= {arXiv preprint arXiv:2208.05445},
year = {2022}
}
备注
EARLY ACCESS of IEEE JSTSP Special Issue on Self-Supervised Learning for Speech and Audio Processing