利用大型预训练模型实现零样本开放词汇跟踪
计算机视觉与模式识别
2024-01-26 v2
摘要
目标跟踪是机器人感知与场景理解的核心。基于检测的跟踪长期作为特定类别目标跟踪的主导范式。近来,大规模预训练模型在野外部景的 2D 静态图像中检测与分割物体及部件方面展现出可喜进展。这引出一个问题:我们能否将这些大规模预训练静态图像模型重新用于开放词汇视频跟踪?本文中,我们将一个开放词汇检测器、分割器与稠密光流估计器改造为一个在 2D 视频中跟踪并分割任意类别物体的模型。我们的方法在单目视频中预测带有相应语言描述的物体与部件轨迹,以现代大规模预训练静态图像检测与分割模型重建 Tractor 流水线:我们检测开放词汇物体实例,并使用基于流的运动模型将其边界框逐帧传播,用视觉检测器的边界框回归模块细化传播框,再以细化框提示开放世界分割器分割物体。我们根据传播框的目标性得分以及前向-后向光流一致性决定物体轨迹的终止。我们使用深度特征匹配在遮挡间重新识别物体。我们表明,我们的模型在多个已有视频物体分割与跟踪基准上取得强劲性能,并能在操作数据中产生合理轨迹。特别地,尽管从未被显式训练用于跟踪,我们的模型在开放世界物体跟踪与分割基准 UVO 和 BURST 上优于先前最优。我们希望我们的方法能作为未来研究的一个简单且可扩展框架。
引用
@article{arxiv.2310.06992,
title = {Zero-Shot Open-Vocabulary Tracking with Large Pre-Trained Models},
author = {Wen-Hsuan Chu and Adam W. Harley and Pavel Tokmakov and Achal Dave and Leonidas Guibas and Katerina Fragkiadaki},
journal= {arXiv preprint arXiv:2310.06992},
year = {2024}
}
备注
Project page available at https://wenhsuanchu.github.io/ovtracktor/