中文

xT:用于大图像更大上下文的嵌套词元化

计算机视觉与模式识别 2024-07-23 v2 人工智能

摘要

现代计算机视觉流水线以两种次优方式之一处理大图像:下采样或裁剪。这两种方法都会导致图像中存在的信息和上下文大量丢失。在许多下游应用中,全局上下文与高频细节同样重要,例如在真实世界的卫星图像中;在这种情况下,研究人员不得不做出舍弃哪些信息这一令人为难的选择。我们引入了 xT,这是一个用于视觉 Transformer 的简单框架,它能有效地聚合全局上下文与局部细节,并能在当代 GPU 上对大图像进行端到端建模。我们选择了一组涵盖经典视觉任务的基准数据集,这些数据集能准确反映视觉模型理解真正大图像的能力以及在大尺度上纳入精细细节的能力,并评估了我们的方法在这些数据集上的改进。xT 是一种流式两阶段架构,它适配现有的视觉骨干网络和长序列语言模型,以在不产生二次内存增长的情况下有效地对大图像进行建模。在具有挑战性的分类任务中,我们能够将准确率提高多达 8.6%,在像素高达 29,000 x 29,000 的图像上,上下文相关的分割任务的 F1F_1 分数提高了 11.6。

关键词

引用

@article{arxiv.2403.01915,
  title  = {xT: Nested Tokenization for Larger Context in Large Images},
  author = {Ritwik Gupta and Shufan Li and Tyler Zhu and Jitendra Malik and Trevor Darrell and Karttikeya Mangalam},
  journal= {arXiv preprint arXiv:2403.01915},
  year   = {2024}
}

备注

Accepted to the 2024 International Conference on Machine Learning (ICML)