VOVTrack:探索视频中开放词汇目标跟踪的潜能
计算机视觉与模式识别
2024-10-14 v1 人工智能
摘要
开放词汇多目标跟踪(OVMOT)代表了一项新的关键挑战,涉及在视频中检测和跟踪多样化的对象类别,包括已见类别(基类)和未见类别(新类别)。该问题融合了开放词汇目标检测(OVD)和多目标跟踪(MOT)的复杂性。现有方法往往将OVD和MOT方法作为独立模块合并,主要通过图像中心视角关注问题。在本文中,我们提出VOVTrack,一种从视频对象跟踪的角度解决该挑战的新方法,将对象状态与视频中心训练集成。首先,我们考虑跟踪期间对象的状态,提出一种新的提示引导注意力机制,以实现对时间变化对象的更准确局部化和分类(检测)。随后,我们利用无注释的原始视频数据进行训练,通过构建自监督对象相似性学习技术来促进时间对象关联(跟踪)。实验结果表明,VOVTrack超越了现有方法,成为开放词汇跟踪任务的state-of-the-art解决方案。
引用
@article{arxiv.2410.08529,
title = {VOVTrack: Exploring the Potentiality in Videos for Open-Vocabulary Object Tracking},
author = {Zekun Qian and Ruize Han and Junhui Hou and Linqi Song and Wei Feng},
journal= {arXiv preprint arXiv:2410.08529},
year = {2024}
}