告别 RGB:最小化解码的 JPEG Vision Transformers
计算机视觉与模式识别
2023-06-16 v2 图像与视频处理
摘要
大多数用于计算机视觉的神经网络被设计为使用 RGB 图像进行推理。然而,这些 RGB 图像在保存到磁盘之前通常被编码为 JPEG;对它们进行解码给 RGB 网络带来了不可避免的开销。相反,我们的工作侧重于直接从 JPEG 的编码特征训练 Vision Transformers (ViT)。这样,我们可以避免大部分解码开销,加速数据加载。现有工作已经研究了这一方面,但它们侧重于 CNN。由于这些编码特征的结构方式,CNN 需要对其架构进行大幅修改才能接收此类数据。在这里,我们表明 ViT 并非如此。此外,我们直接在这些编码特征上处理数据增强,据我们所知,这在该设置下的训练中尚未得到深入探索。通过这两项改进——ViT 和数据增强——我们表明,与 RGB 对应模型相比,我们的 ViT-Ti 模型实现了高达 39.2% 的更快训练速度和 17.9% 的更快推理速度,且没有精度损失。
引用
@article{arxiv.2211.16421,
title = {RGB no more: Minimally-decoded JPEG Vision Transformers},
author = {Jeongsoo Park and Justin Johnson},
journal= {arXiv preprint arXiv:2211.16421},
year = {2023}
}
备注
17 pages, 6 figures, 6 tables