中文

面向视觉、语音与语言的高效自监督学习:基于语境化目标表示

机器学习 2023-06-16 v2 计算与语言 声音 音频与语音处理

摘要

当前的自监督学习算法通常是模态特定的,且需要大量计算资源。为解决这些问题,我们提升了 data2vec 的训练效率,data2vec 是一个跨多种模态泛化的学习目标。我们不对掩码 token 进行编码,使用快速卷积解码器,并分摊构建教师表示的开销。data2vec 2.0 受益于 data2vec 中引入的丰富语境化目标表示,从而实现了快速的自监督学习器。在 ImageNet-1K 图像分类上的实验表明,data2vec 2.0 以 16.4 倍更短的训练时间达到了 Masked Autoencoders 的精度;在 Librispeech 语音识别上,它以 10.6 倍更少的时间取得了与 wav2vec 2.0 相当的性能;在 GLUE 自然语言理解上,它以一半的时间匹配了重新训练的 RoBERTa 模型。以一定速度为代价换取精度,可在训练 150 轮的 ViT-L 模型上取得 ImageNet-1K top-1 精度 86.8\%。

关键词

引用

@article{arxiv.2212.07525,
  title  = {Efficient Self-supervised Learning with Contextualized Target Representations for Vision, Speech and Language},
  author = {Alexei Baevski and Arun Babu and Wei-Ning Hsu and Michael Auli},
  journal= {arXiv preprint arXiv:2212.07525},
  year   = {2023}
}