中文

SeiT:利用 Token 以 1% 像素存储进行存储高效的视觉训练

计算机视觉与模式识别 2023-09-12 v2

摘要

我们需要十亿级图像来获得更具泛化能力和突破性的视觉模型,以及海量的数据集存储来承载这些图像(例如 LAION-4B 数据集需要 240TB 存储空间)。然而,在有限的存储基础设施下处理无限的数据集存储已变得极具挑战。已有若干存储高效训练方法被提出以应对该问题,但它们往往难以扩展或遭受严重的性能损失。本文中,我们提出了一种面向大规模数据集(如 ImageNet)视觉分类器的存储高效训练策略,该策略每个样本仅使用 1024 个 token,而不使用原始像素;我们的 token 存储仅需原始 JPEG 压缩原始像素的 <1%。我们还提出了 token 增强与一个 Stem-adaptor 模块,使我们的方法能够使用与基于像素的方法相同的架构,仅对 stem 层做极小修改并配合精心调优的优化设置。我们在 ImageNet-1k 上的实验结果表明,我们的方法以较大优势显著优于其他存储高效训练方法。我们进一步展示了我们的方法在其他实际场景、存储高效预训练以及持续学习中的有效性。代码见 https://github.com/naver-ai/seit

关键词

引用

@article{arxiv.2303.11114,
  title  = {SeiT: Storage-Efficient Vision Training with Tokens Using 1% of Pixel Storage},
  author = {Song Park and Sanghyuk Chun and Byeongho Heo and Wonjae Kim and Sangdoo Yun},
  journal= {arXiv preprint arXiv:2303.11114},
  year   = {2023}
}

备注

ICCV 2023; First two authors contributed equally; code url: https://github.com/naver-ai/seit; 17 pages, 1.2MB