中文

基于视觉接地与掩码语言建模的语音自监督表示学习

音频与语音处理 2022-03-03 v2 计算与语言 计算机视觉与模式识别 机器学习 声音

摘要

本文描述了我们向 ZeroSpeech 2021 挑战赛与 SUPERB 基准提交的系统。我们的提交基于近期提出的 FaST-VGS 模型,这是一个基于 Transformer 的模型,学习将原始语音波形与语义相关图像相关联,且不使用任何语音转写文本。此外,我们引入了该模型的新扩展 FaST-VGS+,它以多任务方式在视觉接地目标之外结合掩码语言建模目标进行学习。在 ZeroSpeech 2021 上,我们表明我们的模型在 ABX 任务上表现具竞争力,在句法与语义任务上优于所有其他同期提交,并在词汇任务上近乎匹敌最佳系统。在 SUPERB 基准上,我们表明我们的模型同样取得强劲表现,在某些情况下甚至优于流行的 wav2vec2.0 模型。

关键词

引用

@article{arxiv.2202.03543,
  title  = {Self-Supervised Representation Learning for Speech Using Visual Grounding and Masked Language Modeling},
  author = {Puyuan Peng and David Harwath},
  journal= {arXiv preprint arXiv:2202.03543},
  year   = {2022}
}

备注

SAS workshop at AAAI2022, code and model weights available at https://github.com/jasonppy/FaST-VGS-Family