Wav2vec-C:一种用于语音表征学习的自监督模型
音频与语音处理
2021-06-25 v2 机器学习
声音
摘要
Wav2vec-C 引入了一种结合 wav2vec 2.0 和 VQ-VAE 元素的新型表征学习技术。我们的模型学习使用对比损失从部分掩码的语音编码中重现量化表征,方式类似于 Wav2vec 2.0。然而,量化过程由一个额外的一致性网络正则化,该网络学习从量化表征重建 wav2vec 2.0 网络的输入特征,方式类似于 VQ-VAE 模型。所提出的自监督模型在 10k 小时无标签数据上训练,随后用作 RNN-T ASR 模型中的语音编码器,并用 1k 小时有标签数据微调。这项工作是少数几个在具有大量真实远场有标签数据的语音任务上进行自监督学习的研究之一。与基线相比,Wav2vec-C 编码表征平均实现了两倍的错误率降低,并且与 wav2vec 2.0 相比具有更高的码本利用率。
引用
@article{arxiv.2103.08393,
title = {Wav2vec-C: A Self-supervised Model for Speech Representation Learning},
author = {Samik Sadhu and Di He and Che-Wei Huang and Sri Harish Mallidi and Minhua Wu and Ariya Rastrow and Andreas Stolcke and Jasha Droppo and Roland Maas},
journal= {arXiv preprint arXiv:2103.08393},
year = {2021}
}
备注
To appear in Interspeech 2021