Awesome 多模态目标跟踪
计算机视觉与模式识别
2024-06-03 v2 人工智能
摘要
多模态目标跟踪(MMOT)是一种结合来自各种模态(例如视觉(RGB)、深度、热红外、事件、语言和音频)数据以估计视频序列中任意对象状态的 emerging 领域。对于许多应用(如自动驾驶和智能监控)具有重要意义。近年来,MMOT 收到更多关注。然而,现有的 MMOT 算法主要聚焦于两种模态(例如 RGB+depth、RGB+thermal infrared 和 RGB+language)。为更好地利用多模态,最近有研究尝试学习面向任意模态的统一视觉目标跟踪模型。此外,一些大规模多模态跟踪基准也已同时提供多于两种模态,例如视觉-语言-音频(如 WebUAV-3M)和视觉-深度-语言(如 UniMod1K)。为跟踪 MMOT 的最新进展,我们在此报告中进行全面调查。具体而言,我们首先将现有的 MMOT 任务分为五个主要类别,即 RGBL 跟踪、RGBE 跟踪、RGBD 跟踪、RGBT 跟踪和其他(RGB+X),其中 X 可以是任何模态,如语言、深度和事件。然后,我们关注广泛使用的数据集和基于其技术范例(如自监督学习、提示学习、知识蒸馏、生成模型和状态空间模型)的主流跟踪算法进行分析和总结。最后,我们在 https://github.com/983632847/Awesome-Multimodal-Object-Tracking 上持续更新 MMOT 的论文列表。
引用
@article{arxiv.2405.14200,
title = {Awesome Multi-modal Object Tracking},
author = {Chunhui Zhang and Li Liu and Hao Wen and Xi Zhou and Yanfeng Wang},
journal= {arXiv preprint arXiv:2405.14200},
year = {2024}
}
备注
A continuously updated project to track the latest progress in multi-modal object tracking