中文

Hopper:用于时空推理的多跳 Transformer

计算机视觉与模式识别 2021-03-23 v2

摘要

本文考虑视频中时空以对象为中心的推理问题。我们方法的核心在于对象恒存性这一概念,即能够在对象于视频中移动并被遮挡、容纳或由其对象携带时推理其位置的能力。现有的基于深度学习的方法在应用于视频推理问题时常常受时空偏差困扰。我们提出 Hopper,其使用多跳 Transformer 来推理视频中的对象恒存性。给定视频与定位查询,Hopper 对图像与对象轨迹进行推理,以迭代方式自动跳过关键帧,预测感兴趣对象的最终位置。我们展示了使用对比损失来减少时空偏差的有效性。我们在 CATER 数据集上评估,发现 Hopper 仅以 1 FPS 跳过少数关键帧便达到了 73.2% 的 Top-1 准确率。我们还通过构建 CATER-h 数据集证明 Hopper 可进行长期推理,该数据集需要多步推理才能正确定位感兴趣对象。

关键词

引用

@article{arxiv.2103.10574,
  title  = {Hopper: Multi-hop Transformer for Spatiotemporal Reasoning},
  author = {Honglu Zhou and Asim Kadav and Farley Lai and Alexandru Niculescu-Mizil and Martin Renqiang Min and Mubbasir Kapadia and Hans Peter Graf},
  journal= {arXiv preprint arXiv:2103.10574},
  year   = {2021}
}