CoBERT:通过码表示学习的自监督语音表征学习
声音
2023-07-06 v3 音频与语音处理
摘要
语音是一组有限语音单元的表面形式,可由离散码表示。我们提出码 BERT(CoBERT)方法用于自监督语音表征学习。其思路是将话语转换为离散码序列,并进行码表示学习,基于原始语音输入的掩码视图预测码表示。不同于先前教师与学生同模态的自蒸馏方法,我们的目标模型从不同模态预测表示。CoBERT 在 ASR 任务上优于最新最优性能,并在 SUPERB 语音翻译(ST)任务上带来显著提升。我们的代码与模型发布于 https://github.com/mct10/CoBERT。
引用
@article{arxiv.2210.04062,
title = {CoBERT: Self-Supervised Speech Representation Learning Through Code Representation Learning},
author = {Chutong Meng and Junyi Ao and Tom Ko and Mingxuan Wang and Haizhou Li},
journal= {arXiv preprint arXiv:2210.04062},
year = {2023}
}
备注
Accepted by Interspeech 2023