全局实例跟踪:以更类人的方式定位目标
计算机视觉与模式识别
2022-03-01 v1
摘要
目标跟踪作为人类视觉系统的基本能力,已被计算机视觉任务所模拟。然而,现有跟踪器在严苛实验环境中表现良好,却在遮挡和快速运动等挑战下失效。这一巨大差距表明,研究仅衡量了跟踪性能而非智能水平。如何科学评判跟踪器的智能水平?与决策问题不同,缺乏三项要求(具有挑战性的任务、公平的环境以及科学的评估流程)使得该问题难以回答。本文中,我们首次提出全局实例跟踪(GIT)任务,旨在无需任何关于相机或运动一致性的假设下于视频中搜索任意用户指定实例,以建模人类视觉跟踪能力。随后,我们构建了高质量大规模基准 VideoCube 以营造具有挑战性的环境。最后,我们设计了以人类能力为基线来评判跟踪智能的科学评估流程。此外,我们提供了一个带工具包的在线平台及更新的排行榜。尽管实验结果表明跟踪器与人类间存在明确差距,我们期望能向前迈出一步以生成真实类人的跟踪器。数据库、工具包、评估服务器及基线结果可在 http://videocube.aitestunion.com 获取。
引用
@article{arxiv.2202.13073,
title = {Global Instance Tracking: Locating Target More Like Humans},
author = {Shiyu Hu and Xin Zhao and Lianghua Huang and Kaiqi Huang},
journal= {arXiv preprint arXiv:2202.13073},
year = {2022}
}
备注
This paper is published in IEEE TPAMI (refer to DOI). Please cite the published IEEE TPAMI