跨视角指代多目标跟踪
计算机视觉与模式识别
2024-12-24 v1 人工智能
摘要
指代多目标跟踪(RMOT)是当前跟踪领域的重要议题。其任务形式是引导跟踪器跟踪与语言描述匹配的目标。当前研究主要聚焦于单视角下的指代多目标跟踪,即单一视角序列或多个无关视角序列。然而,在单视角中,目标的某些外观容易不可见,导致与语言描述不匹配。本文提出了新任务——跨视角指代多目标跟踪(CRMOT),通过引入跨视角获取目标的多种外观,避免RMOT任务中目标外观不可见的问题。CRMOT是一项更具挑战性的任务,旨在准确跟踪匹配语言描述的目标,并在每个跨视角中维持目标的身份一致性。为推进CRMOT任务,我们基于CAMPUS和DIVOTrack数据集构建了跨视角指代多目标跟踪基准,命名为CRTrack。具体而言,它提供13种不同场景和221条语言描述。此外,我们提出了一种端到端的跨视角指代多目标跟踪方法,命名为CRTracker。在CRTrack基准上进行的大量实验验证了本方法的有效性。数据集和代码已公开:https://github.com/chen-si-jia/CRMOT
引用
@article{arxiv.2412.17807,
title = {Cross-View Referring Multi-Object Tracking},
author = {Sijia Chen and En Yu and Wenbing Tao},
journal= {arXiv preprint arXiv:2412.17807},
year = {2024}
}
备注
Accepted by AAAI 2025!