中文

TAPIR:基于逐帧初始化与时间细化的任意点跟踪

计算机视觉与模式识别 2023-08-31 v2

摘要

我们提出了一种用于任意点跟踪(TAP)的新模型,该模型能够在整个视频序列中有效跟踪任意物理表面上任何被查询的点。我们的方法采用两个阶段:(1)匹配阶段,独立地在每一其他帧上为查询点定位一个合适的候选点匹配;(2)细化阶段,基于局部相关性更新轨迹与查询特征。所得模型在 TAP-Vid 基准上以显著优势超越所有基线方法,如在 DAVIS 上平均 Jaccard(AJ)绝对提升约 20%。我们的模型能够在长且高分辨率的视频序列上实现快速推理。在现代 GPU 上,我们的实现能够以快于实时的速度跟踪点,并可灵活扩展至更高分辨率视频。鉴于从大规模数据集中提取的高质量轨迹,我们展示了一个概念验证的扩散模型,该模型从静态图像生成轨迹,实现合理的动画效果。可视化结果、源代码和预训练模型可在我们的项目网页上找到。

关键词

引用

@article{arxiv.2306.08637,
  title  = {TAPIR: Tracking Any Point with per-frame Initialization and temporal Refinement},
  author = {Carl Doersch and Yi Yang and Mel Vecerik and Dilara Gokay and Ankush Gupta and Yusuf Aytar and Joao Carreira and Andrew Zisserman},
  journal= {arXiv preprint arXiv:2306.08637},
  year   = {2023}
}

备注

Published at ICCV 2023