中文

基于前置任务的自我监督学习能否由下游数据增强?一项理论分析

机器学习 2022-02-24 v4 人工智能 机器学习

摘要

基于前置任务的自我监督学习通过手工设计的 pretext 任务在无标注数据上学习语义表示,然后将所学表示用于下游任务,在条件独立(CI)条件下有效降低了下游任务的样本复杂度。然而,若 CI 条件不成立,下游样本复杂度会显著恶化。一个有趣的问题是,我们能否利用下游数据精炼无标注数据以使 CI 条件成立,从而增强自我监督学习。乍看之下,有人可能认为提前看到下游数据总会提升下游性能。然而,我们表明这并非直观成立,并指出在某些情况下反而会损害最终性能。具体地,我们证明了用于数据精炼的下游样本数量的模型无关与模型相关下界。此外,我们在合成与真实世界数据集上进行了多种实验以验证我们的理论结果。

关键词

引用

@article{arxiv.2103.03568,
  title  = {Can Pretext-Based Self-Supervised Learning Be Boosted by Downstream Data? A Theoretical Analysis},
  author = {Jiaye Teng and Weiran Huang and Haowei He},
  journal= {arXiv preprint arXiv:2103.03568},
  year   = {2022}
}

备注

Accepted by AISTATS 2022