面向指向性多目标跟踪的认知解耦
计算机视觉与模式识别
2025-05-28 v4
摘要
作为多源信息融合在智能交通感知系统中的重要应用,指向性多目标跟踪 (RMOT) 涉及基于语言引用在视频序列中定位和跟踪特定对象。然而,现有的 RMOT 方法通常将语言描述视为整体嵌入,难以将语言表达中包含的丰富语义信息与视觉特征有效整合。这一局限性在需要综合理解静态对象属性和空间运动信息的复杂场景中尤为明显。在本文中,我们提出了一种用于指向性多目标跟踪的认知解耦 (CDRMT) 框架来解决这些挑战。它将人类视觉处理系统中的“什么”和“何地”通路适配到 RMOT 任务中。具体而言,我们的框架首先在保持模态特定特征的同时建立跨模态连接。然后,它解耦语言描述并将其分层注入对象查询中,从粗到细的语义层次细化对象理解。最后,我们基于视觉特征重构语言表示,确保被跟踪对象忠实反映指向性表达。在不同基准数据集上的大量实验表明,CDRMT 相较于 SOTA 方法取得了显著提升,在 Refer-KITTI 上的 HOTA 得分平均提升 6.0%,在 Refer-KITTI-V2 上平均提升 3.2%。我们的方法推进了 RMOT 领域的 SOTA,同时为多源信息融合提供了新见解。
引用
@article{arxiv.2503.11496,
title = {Cognitive Disentanglement for Referring Multi-Object Tracking},
author = {Shaofeng Liang and Runwei Guan and Wangwang Lian and Daizong Liu and Xiaolou Sun and Dongming Wu and Yutao Yue and Weiping Ding and Hui Xiong},
journal= {arXiv preprint arXiv:2503.11496},
year = {2025}
}
备注
27 pages, 12 figures