从单一自然语言描述学习实例跟踪
计算机视觉与模式识别
2026-05-11 v1
摘要
如何实现基于自然语言描述的视觉语言(VL)跟踪,而不依赖任何边界框标注?本文通过解决“自监督式VL跟踪”问题来实现这一目标,即利用自然语言描述来指导跟踪能力评估。我们引入了\textbf{\tracker},一种新型自监督式VL跟踪器,能够通过语言描述跟踪任意指代对象。不同于传统方法对所有语言和视觉标记等量融合的方法,我们提出了高效的动态标记聚合模块(Dynamic Token Aggregation Module),其对视觉标记不等处理。该模块包含三个主要步骤:i)基于锚定标记,选择模板帧中多个重要目标标记。ii)根据注意力得分将选定的目标标记合并并聚合到语言标记中,从而消除冗余的视觉标记噪声并增强语义对齐。iii)最终,融合后的语言标记作为指导信号,用于从搜索帧中提取潜在目标标记并传递到后续帧中,增强时序提示,并鼓励跟踪器自主学习来自无标签视频的实例跟踪。这种新颖的建模方法使得无需大规模边界框标注即可有效地进行语言指导跟踪表征的自监督学习。在VL跟踪基准测试上进行了大量实验,表明{\tracker}在SOTA自监督方法方面取得了优异性能。
引用
@article{arxiv.2605.07064,
title = {Learning to Track Instance from Single Nature Language Description},
author = {Yaozong Zheng and Bineng Zhong and Qihua Liang and Shuimu Zeng and Haiying Xia and Shuxiang Song},
journal= {arXiv preprint arXiv:2605.07064},
year = {2026}
}
备注
CVPR 2026