中文

TokenLearner:8 个学习到的令牌能为图像和视频做什么?

计算机视觉与模式识别 2022-04-05 v4 机器学习

摘要

本文中,我们引入一种新颖的视觉表示学习,其依赖于少量自适应学习的令牌,并适用于图像与视频理解任务。我们的方法不依赖手工设计的分割策略来获取视觉令牌并处理大量密集采样的图像块进行注意力计算,而是学习挖掘视觉数据中的重要令牌。这得以高效且有效地找到少数重要视觉令牌,并能够对视频上此类令牌间进行更长时域的成对注意力建模,或图像中的空间内容建模。我们的实验在若干具有挑战性的图像与视频识别任务基准上展示了强劲性能。重要的是,由于我们的令牌是自适应的,我们以显著减少的计算量取得了有竞争力的结果。我们在 ImageNet 上获得了与最先进技术可比的结果,同时计算上更高效。我们也在多个视频数据集上确认了该方法的有效性,包括 Kinetics-400、Kinetics-600、Charades 和 AViD。代码见:https://github.com/google-research/scenic/tree/main/scenic/projects/token_learner

关键词

引用

@article{arxiv.2106.11297,
  title  = {TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?},
  author = {Michael S. Ryoo and AJ Piergiovanni and Anurag Arnab and Mostafa Dehghani and Anelia Angelova},
  journal= {arXiv preprint arXiv:2106.11297},
  year   = {2022}
}

备注

This is the full version of the paper, extending its conference paper at NeurIPS 2021. Version 1.1 of the code is released