中文

指称多目标跟踪

计算机视觉与模式识别 2023-03-14 v2

摘要

现有的指称理解任务往往涉及单个文本指称物体的检测。本文提出一种新的通用指称理解任务,称为指称多目标跟踪(RMOT)。其核心思想是利用语言表达式作为语义线索来引导多目标跟踪的预测。据我们所知,这是首个在视频中实现任意数量指称物体预测的工作。为推动 RMOT,我们基于 KITTI 构建了一个带有可扩展表达式的基准,名为 Refer-KITTI。具体而言,它提供 18 个视频与 818 个表达式,且每个视频中的表达式平均标注了 10.7 个物体。此外,我们开发了基于 transformer 的架构 TransRMOT,以在线方式解决该新任务,其取得了令人印象深刻的检测性能并优于其他同类方法。数据集与代码将发布于 https://github.com/wudongming97/RMOT。

关键词

引用

@article{arxiv.2303.03366,
  title  = {Referring Multi-Object Tracking},
  author = {Dongming Wu and Wencheng Han and Tiancai Wang and Xingping Dong and Xiangyu Zhang and Jianbing Shen},
  journal= {arXiv preprint arXiv:2303.03366},
  year   = {2023}
}

备注

Accpeted by CVPR 2023. The dataset and code will be available at https://github.com/wudongming97/RMOT