中文

跨视角指代多目标跟踪

计算机视觉与模式识别 2024-12-24 v1 人工智能

摘要

指代多目标跟踪(RMOT)是当前跟踪领域的重要议题。其任务形式是引导跟踪器跟踪与语言描述匹配的目标。当前研究主要聚焦于单视角下的指代多目标跟踪,即单一视角序列或多个无关视角序列。然而,在单视角中,目标的某些外观容易不可见,导致与语言描述不匹配。本文提出了新任务——跨视角指代多目标跟踪(CRMOT),通过引入跨视角获取目标的多种外观,避免RMOT任务中目标外观不可见的问题。CRMOT是一项更具挑战性的任务,旨在准确跟踪匹配语言描述的目标,并在每个跨视角中维持目标的身份一致性。为推进CRMOT任务,我们基于CAMPUS和DIVOTrack数据集构建了跨视角指代多目标跟踪基准,命名为CRTrack。具体而言,它提供13种不同场景和221条语言描述。此外,我们提出了一种端到端的跨视角指代多目标跟踪方法,命名为CRTracker。在CRTrack基准上进行的大量实验验证了本方法的有效性。数据集和代码已公开:https://github.com/chen-si-jia/CRMOT

关键词

引用

@article{arxiv.2412.17807,
  title  = {Cross-View Referring Multi-Object Tracking},
  author = {Sijia Chen and En Yu and Wenbing Tao},
  journal= {arXiv preprint arXiv:2412.17807},
  year   = {2024}
}

备注

Accepted by AAAI 2025!