TAP-Vid:视频中任意点跟踪的基准
计算机视觉与模式识别
2023-04-03 v2 机器学习
摘要
从视频中理解通用运动不仅涉及跟踪物体,还涉及感知其表面如何形变与运动。这些信息有助于对三维形状、物理属性和物体交互进行推断。尽管在较长视频片段上跟踪表面任意物理点的问题已受到一定关注,但迄今为止尚无用于评估的数据集或基准。在本文中,我们首先形式化该问题,将其命名为任意点跟踪(TAP)。我们引入了一个配套基准TAP-Vid,它由带有精确人工标注点轨迹的真实世界视频,以及具有完美真值点轨迹的合成视频组成。我们基准构建的核心是一种新颖的半自动众包流程,其利用光流估计来补偿如相机抖动等较容易的短期运动,使标注者能够专注于视频中更困难的部分。我们在合成数据上验证了该流程,并提出了一种简单的端到端点跟踪模型TAP-Net,表明其在合成数据上训练时优于我们基准上的所有先前方法。
引用
@article{arxiv.2211.03726,
title = {TAP-Vid: A Benchmark for Tracking Any Point in a Video},
author = {Carl Doersch and Ankush Gupta and Larisa Markeeva and Adrià Recasens and Lucas Smaira and Yusuf Aytar and João Carreira and Andrew Zisserman and Yi Yang},
journal= {arXiv preprint arXiv:2211.03726},
year = {2023}
}
备注
Published in NeurIPS Datasets and Benchmarks track, 2022