ReaMOT:基于推理的多目标跟踪的基准与框架
计算机视觉与模式识别
2026-05-12 v4
摘要
指代多目标跟踪(RMOT)旨在跟踪由语言指令指定的目标。然而,现有的RMOT范式严重依赖显式的视觉-文本匹配,因此无法泛化到需要逻辑推理的复杂指令。为了克服这一点,我们提出了基于推理的多目标跟踪(ReaMOT),一项将跟踪提升至认知层面的新颖任务,要求模型通过逻辑推理推断并跟踪满足隐式约束的特定目标。为了推进该领域,我们构建了ReaMOT挑战,一个包含定制指标套件和大规模数据集的综合基准。该数据集包含1,156条语言指令、423,359个图像-语言对和869个不同的视频序列,系统地分为六个不同的评估场景,其中超过75%的指令专用于高级推理。此外,鉴于传统跟踪器缺乏认知能力,而直接应用大视觉语言模型(LVLM)会产生严重的时序不一致性,我们提出了ReaTrack。受将高级认知定位与低级物理运动连续性解耦的启发,这个免训练框架将Thinking变体LVLM的语义检测与SAM2的稳健运动先验动态对齐。在ReaMOT挑战基准上的大量实验表明,ReaTrack确立了新的领先性能标准。值得注意的是,它在高级推理子集上的RHOTA提升了三倍以上。我们的数据集和代码将发布于 https://github.com/chen-si-jia/ReaMOT。
引用
@article{arxiv.2505.20381,
title = {ReaMOT: A Benchmark and Framework for Reasoning-based Multi-Object Tracking},
author = {Sijia Chen and Yanqiu Yu and En Yu and Wenbing Tao},
journal= {arXiv preprint arXiv:2505.20381},
year = {2026}
}
备注
Code: https://github.com/chen-si-jia/ReaMOT