跨模态目标跟踪:模态感知表示与统一基准
计算机视觉与模式识别
2021-11-12 v2
摘要
在许多视觉系统中,视觉跟踪通常基于 RGB 图像序列,其中一些目标在低光照条件下失效,从而显著影响跟踪性能。引入深度和红外数据等其他模态是处理单一源成像限制的有效方式,但多模态成像平台通常需要精心设计,目前无法应用于许多真实场景。近红外(NIR)成像已成为许多监控摄像头的重要组成部分,其成像根据光强在 RGB 和 NIR 之间可切换。这两种模态具有异质性且视觉属性差异很大,从而给视觉跟踪带来巨大挑战。然而,现有工作尚未研究这一挑战性问题。在本工作中,我们解决跨模态目标跟踪问题,并贡献了一个新视频数据集,包含 654 个跨模态图像序列,总计超过 481K 帧,平均视频长度超过 735 帧。为促进跨模态目标跟踪的研究与开发,我们提出了一种新算法,其学习模态感知目标表示以缓解跟踪过程中 RGB 与 NIR 模态之间的表观差异。它是即插即用的,因此可灵活嵌入不同跟踪框架。我们在该数据集上进行了大量实验,并在两个代表性跟踪框架中针对 17 种最先进跟踪方法证明了所提算法的有效性。我们将免费发布该数据集用于学术用途,数据集下载链接和代码将很快发布。
引用
@article{arxiv.2111.04264,
title = {Cross-Modal Object Tracking: Modality-Aware Representations and A Unified Benchmark},
author = {Chenglong Li and Tianhao Zhu and Lei Liu and Xiaonan Si and Zilin Fan and Sulan Zhai},
journal= {arXiv preprint arXiv:2111.04264},
year = {2021}
}
备注
In Submission