ReferGPT:面向零样本的指涉式多目标跟踪
计算机视觉与模式识别
2025-04-15 v1 人工智能
摘要
基于文本查询跟踪多个目标是一项具有挑战性的任务,需要将语言理解与跨帧的对象关联相结合。以往的工作通常端到端训练整个流程,或将额外的指涉文本模块集成到多目标跟踪器中,但它们都需要监督训练,并且可能在面对开放查询时难以实现良好泛化。本文介绍了ReferGPT,一种新的零样本指涉式多目标跟踪框架。我们提供一种具备空间知识的多模态大语言模型(MLLM),使其能够生成三维感知的描述性文本。这是一种增强其描述能力的方式,支持无需训练即可实现更灵活的指涉词汇。我们还提出了一种稳健的查询匹配策略,利用基于CLIP的语义编码和模糊匹配,将MLLM生成的描述性文本与用户查询关联。针对Refer-KITTI、Refer-KITTIv2和Refer-KITTI+上的大量实验表明,ReferGPT在性能上与训练方法相当,展示了其在自动驾驶领域的鲁棒性和零样本能力。代码已公开于https://github.com/Tzoulio/ReferGPT
引用
@article{arxiv.2504.09195,
title = {ReferGPT: Towards Zero-Shot Referring Multi-Object Tracking},
author = {Tzoulio Chamiti and Leandro Di Bella and Adrian Munteanu and Nikos Deligiannis},
journal= {arXiv preprint arXiv:2504.09195},
year = {2025}
}
备注
Accepted CVPR 2025 Workshop on Distillation of Foundation Models for Autonomous Driving