中文

INTERN:一种面向通用视觉的新学习范式

计算机视觉与模式识别 2022-02-25 v2 人工智能 机器学习

摘要

过去几年中,以 AI 技术进步为标志的技术创新浪潮正在深刻重塑产业与社会。然而,在前行的道路上,一个关键挑战正等待我们,即我们满足快速增长的特定场景需求的能力受到获取相应规模训练数据成本的严重限制。这一困境本质上源于主流学习范式的局限:我们需要为每个新场景训练一个新模型,基于大量精标注数据且通常从零开始。为解决这一根本问题,我们超越并开发了一种名为 INTERN 的新学习范式。通过多阶段利用来自多源的监控信号进行学习,被训练的模型将发展出强大的泛化能力。我们在涵盖计算机视觉四类任务的 26 个知名数据集上评估了我们的模型。在大多数情况下,我们的模型仅使用目标领域 10% 的训练数据进行调整,便优于使用全量数据训练的对应模型,且常大幅领先。这是朝着一个有前景前景的重要一步,即具有通用视觉能力的此类模型可大幅减少我们对数据的依赖,从而加快 AI 技术的采用。此外,围绕我们的新范式,我们还引入了新的数据系统、新的架构和新的基准,它们共同构成一个以开放和包容方式支持其未来发展的通用视觉生态系统。项目网站见 https://opengvlab.shlab.org.cn 。

关键词

引用

@article{arxiv.2111.08687,
  title  = {INTERN: A New Learning Paradigm Towards General Vision},
  author = {Jing Shao and Siyu Chen and Yangguang Li and Kun Wang and Zhenfei Yin and Yinan He and Jianing Teng and Qinghong Sun and Mengya Gao and Jihao Liu and Gengshi Huang and Guanglu Song and Yichao Wu and Yuming Huang and Fenggang Liu and Huan Peng and Shuo Qin and Chengyu Wang and Yujie Wang and Conghui He and Ding Liang and Yu Liu and Fengwei Yu and Junjie Yan and Dahua Lin and Xiaogang Wang and Yu Qiao},
  journal= {arXiv preprint arXiv:2111.08687},
  year   = {2022}
}