通过模态感知融合网络和大规模数据集实现的跨模态目标跟踪
计算机视觉与模式识别
2023-12-25 v1
摘要
仅依赖 RGB 图像序列的视觉跟踪往往面临无效目标和低光照条件下性能下降等挑战。虽然引入深度和红外数据等额外模态已被证明有效,但现有的多模态成像平台复杂且缺乏现实适用性。相比之下,常用于监控摄像头的近红外 (NIR) 成像可以根据光强在 RGB 和 NIR 之间切换。然而,在这些异构模态间跟踪目标构成了重大挑战,特别是由于跟踪过程中缺乏模态切换信号。为应对这些挑战,我们提出了一种自适应跨模态目标跟踪算法,称为模态感知融合网络 (MAFNet)。MAFNet 利用自适应加权机制高效整合 RGB 和 NIR 模态的信息,有效弥合外观差距并实现模态感知的目标表示。它由两个关键组件组成:自适应加权模块和模态特定表示模块......
引用
@article{arxiv.2312.14446,
title = {Cross-Modal Object Tracking via Modality-Aware Fusion Network and A Large-Scale Dataset},
author = {Lei Liu and Mengya Zhang and Cheng Li and Chenglong Li and Jin Tang},
journal= {arXiv preprint arXiv:2312.14446},
year = {2023}
}
备注
In Peer Review