中文

data2vec-aqc:在教师-学生训练框架中寻找合适的助教

音频与语音处理 2023-05-16 v2 人工智能 计算与语言 声音

摘要

本文提出一种称为 data2vec-aqc 的新自监督学习(SSL)算法,用于从无标注语音数据中学习语音表示。我们的目标是在无标注与有标注数据均有限的领域改进语音 SSL。基于近期提出的 data2vec,我们向 data2vec 框架引入额外模块,以利用数据增强、量化表示与聚类的优势。这些模块间的交互有助于将跨对比损失作为附加自监督目标求解。data2vec-aqc 在 LibriSpeech 的 test-clean 和 test-other 集上分别取得比现有最先进 data2vec 系统高达 14.1% 和 20.9% 的相对 WER 提升,且未使用任何语言模型(LM)。当在 Switchboard 数据集子集上微调时,我们提出的模型也取得比基线 data2vec 高达 17.8% 的相对 WER 增益。代码:https://github.com/Speech-Lab-IITM/data2vec-aqc。

关键词

引用

@article{arxiv.2211.01246,
  title  = {data2vec-aqc: Search for the right Teaching Assistant in the Teacher-Student training setup},
  author = {Vasista Sai Lodagala and Sreyan Ghosh and S. Umesh},
  journal= {arXiv preprint arXiv:2211.01246},
  year   = {2023}
}

备注

Accepted to ICASSP 2023