中文

data2vec:一种用于语音、视觉与语言自监督学习的通用框架

机器学习 2022-10-27 v3

摘要

尽管自监督学习的总体思想在不同模态间是一致的,但实际的算法与目标却大相径庭,因为它们都是针对单一模态开发的。为了更接近通用自监督学习,我们提出了 data2vec,这是一个对语音、NLP 或计算机视觉使用相同学习方法的框架。其核心思想是在自蒸馏设置下,基于输入被掩码视图,使用标准 Transformer 架构预测完整输入数据的潜在表示。data2vec 不预测诸如词语、视觉 token 或人类语音单元等具有局部特性的模态特定目标,而是预测包含整个输入信息的上下文潜在表示。在语音识别、图像分类和自然语言理解的主要基准上的实验表明,该方法取得了新的 SOTA 性能或与主流方法相当的性能。

关键词

引用

@article{arxiv.2202.03555,
  title  = {data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language},
  author = {Alexei Baevski and Wei-Ning Hsu and Qiantong Xu and Arun Babu and Jiatao Gu and Michael Auli},
  journal= {arXiv preprint arXiv:2202.03555},
  year   = {2022}
}