时序增强的多模态Transformer用于指代多目标跟踪与分割
计算机视觉与模式识别
2024-10-18 v1
摘要
指代多目标跟踪(RMOT)是一种新兴的跨模态任务,旨在定位由语言表达式指代的任意数量的目标对象,并维持这些对象的身份。在这一复杂任务中,需要对语言和视觉模态进行推理,以及目标对象的时序关联。然而,已有的工作仅采用松散的特征融合,未充分利用对被跟踪对象长期信息的利用。本文引入一种基于Transformer的紧凑方法,称为TenRMOT。在编码和解码阶段进行特征融合,以充分发挥Transformer架构的优势。具体而言,我们在编码阶段逐层递增进行跨模态融合。在解码阶段,我们利用语言引导的查询查询记忆特征,以准确预测所需对象。此外,我们引入一个查询更新模块,显式地利用被跟踪对象的时序先验信息,以增强其轨迹的一致性。此外,我们提出了一个新任务,即指代多目标跟踪与分割(RMOTS),并构建了一个新数据集,称为Ref-KITTI Segmentation。该数据集包含18个视频,818个表达式,其中每个表达式平均包含10.7个掩码,与现有大多数指代视频分割数据集中仅包含单个掩模相比,具有更大的挑战性。TenRMOT在指代多目标跟踪和分割任务上均表现出优异的性能。
引用
@article{arxiv.2410.13437,
title = {Temporal-Enhanced Multimodal Transformer for Referring Multi-Object Tracking and Segmentation},
author = {Changcheng Xiao and Qiong Cao and Yujie Zhong and Xiang Zhang and Tao Wang and Canqun Yang and Long Lan},
journal= {arXiv preprint arXiv:2410.13437},
year = {2024}
}