中文

GPPF:一种基于稀疏激活多任务学习的通用感知预训练框架

计算机视觉与模式识别 2022-08-05 v2

摘要

在混合多任务、多领域和多模态数据上进行预训练仍是视觉感知预训练中的一个开放挑战。本文提出 GPPF,一种通用感知预训练框架(General Perception Pre-training Framework),其在有标签的多任务与多领域数据集上预训练一个任务级动态网络,该网络由各层中的知识“乐高”组成。通过考察人类在复杂环境中学习的先天能力,我们识别并将三个关键要素迁移到深度网络:(1) 在每个批次中同时接触多样的跨任务与跨领域信息;(2) 在知识共享驱动下将知识分区存储于独立乐高单元;(3) 对预训练与下游任务均稀疏激活部分乐高单元。值得注意的是,由于不同视觉任务在输入形状、损失函数、输出格式、数据分布等方面存在差异,其联合训练并非易事。因此,我们创新性地开发了一种即插即用的多任务训练算法,支持单次迭代多任务(Single Iteration Multiple Tasks, SIMT)并发训练。SIMT 为基于大规模多任务多领域数据集的预训练奠定基础,并被证明对我们的 GPPF 实验中的稳定训练至关重要。令人振奋的是,详尽实验表明,我们的 GPPF-R50 模型在 GPPF-15M 的 8 个预训练任务上相较强基线取得 2.5-5.8 的显著提升,并以相似计算预算在 22 个下游任务上收获一系列 SOTA。我们也验证了 GPPF 对 SOTA 视觉变换器的泛化能力及一致提升。这些扎实实验结果充分证明了我们新颖 GPPF 框架所提供的有效知识学习、存储、共享与迁移。

关键词

引用

@article{arxiv.2208.02148,
  title  = {GPPF: A General Perception Pre-training Framework via Sparsely Activated Multi-Task Learning},
  author = {Benyuan Sun and Jin Dai and Zihao Liang and Congying Liu and Yi Yang and Bo Bai},
  journal= {arXiv preprint arXiv:2208.02148},
  year   = {2022}
}

备注

22 pages