键入即跟踪:基于提示的任意目标检索式跟踪
计算机视觉与模式识别
2023-10-03 v3
摘要
视觉问题近期的一个趋势是使用自然语言描述来表达感兴趣对象。该方法可克服依赖边界框或类别标注的传统方法的一些局限。本文提出一种称为 Type-to-Track 的多目标跟踪新范式,允许用户通过键入自然语言描述来跟踪视频中的对象。我们针对该接地多目标跟踪任务提出了一个新数据集 GroOT,包含带有各类对象及其详尽描述外观与动作对应文本描述的视频。此外,我们引入两种新评估协议并制定了专用于该任务的评估指标。我们开发了一种新方法,利用三阶张量分解建模基于 transformer 的嵌入-编码-提取框架(MENDER)。在五种场景下的实验表明,我们的 MENDER 方法在精度与效率上优于另一种两阶段设计,精度提升达 14.7%,速度加快 4。
引用
@article{arxiv.2305.13495,
title = {Type-to-Track: Retrieve Any Object via Prompt-based Tracking},
author = {Pha Nguyen and Kha Gia Quach and Kris Kitani and Khoa Luu},
journal= {arXiv preprint arXiv:2305.13495},
year = {2023}
}
备注
Accepted at NeurIPS 2023. Project page: https://uark-cviu.github.io/Type-to-Track/