面向更灵活准确的自然语言物体跟踪:算法与基准
计算机视觉与模式识别
2021-04-01 v1 人工智能
摘要
基于自然语言描述的跟踪是一项新兴研究课题,旨在根据语言描述在视频序列中定位目标物体。与传统的基于边界框(BBox)的跟踪相比,该设定以高层语义信息引导物体跟踪,解决了边界框的歧义性,并将局部与全局搜索有机联系起来。这些优势可在实际场景中带来更灵活、鲁棒和准确的跟踪性能。然而,现有的自然语言初始化跟踪器是在为基于边界框跟踪提出的基准数据集上开发与比较的,无法反映基于语言跟踪的真实能力。本工作中,我们提出一个专用于基于语言跟踪的新基准,包含大规模数据集、强大且多样的基线方法。具体而言,我们收集了 2k 视频序列(共含 1,244,340 帧、663 个词),并划分 1300/700 用于训练/测试。我们为每个视频密集标注一句英文及目标物体对应的边界框。我们还在 TNL2K 中引入两个物体跟踪任务的新挑战,即对抗样本与模态切换。我们提出一种基于自适应局部-全局搜索方案的强基线方法供未来工作比较。我们相信该基准将极大推动自然语言引导跟踪的相关研究。
引用
@article{arxiv.2103.16746,
title = {Towards More Flexible and Accurate Object Tracking with Natural Language: Algorithms and Benchmark},
author = {Xiao Wang and Xiujun Shu and Zhipeng Zhang and Bo Jiang and Yaowei Wang and Yonghong Tian and Feng Wu},
journal= {arXiv preprint arXiv:2103.16746},
year = {2021}
}
备注
Accepted by CVPR 2021