中文

通过顺序自回归实现数据高效的大型视觉模型

计算机视觉与模式识别 2024-06-07 v1

摘要

在纯顺序视觉数据上训练通用视觉模型并摒弃语言输入,标志着视觉理解的新前沿。这些模型不仅旨在理解视觉内容,还能无缝迁移到域外任务。然而,当前的努力受限于对超大规模模型的过度依赖(例如参数量超过 3B 的模型),以及对庞大视觉语料库的需求(通常包含高达 400B 的 token)。在本文中,我们深入探讨了一种基于自回归的高效视觉模型的开发,该模型经过创新架构设计,可在有限数据集上运行。我们详尽地展示了该模型如何在测试阶段实现从低级到高级语义理解的多种视觉任务的能力。我们的实证评估强调了该模型适应各种任务的敏捷性,预示着参数量足迹的显著减少和训练数据需求的大幅降低,从而为通用视觉模型领域更可持续和更易获取的进步铺平了道路。代码地址:https://github.com/ggjy/DeLVM。

关键词

引用

@article{arxiv.2402.04841,
  title  = {Data-efficient Large Vision Models through Sequential Autoregression},
  author = {Jianyuan Guo and Zhiwei Hao and Chengcheng Wang and Yehui Tang and Han Wu and Han Hu and Kai Han and Chang Xu},
  journal= {arXiv preprint arXiv:2402.04841},
  year   = {2024}
}

备注

15 pages