中文

利用受损多模态数据的真实世界监控可见光-红外行人重识别融合方法

计算机视觉与模式识别 2023-05-02 v1 人工智能 机器学习

摘要

可见光-红外行人重识别(V-I ReID)旨在匹配通过分布式 RGB 和 IR 相机网络捕获的个体图像。该任务具有挑战性,因为 V 与 I 模态之间存在显著差异,尤其在真实世界条件下,图像会受到例如模糊、噪声和天气的损坏。事实上,最先进的 V-I ReID 模型无法利用受损模态信息来维持高水平准确率。在本文中,我们提出了一种用于多模态 V-I ReID 的高效模型——名为多模态中间流融合(Multimodal Middle Stream Fusion, MMSF)——其保留模态特定知识,以提高对受损多模态图像的鲁棒性。此外,三种最先进的基于注意力的多模态融合模型被改造以处理 V-I ReID 中的受损多模态数据,从而动态平衡各模态的重要性。近来,已有评估协议被提出以评估 ReID 模型在挑战性真实场景下的鲁棒性。然而,这些协议仅限于单模态 V 设定。为对多模态(及跨模态)V-I 行人 ReID 模型进行真实评估,我们提出了新的挑战性受损数据集,用于 V 和 I 相机共址(CL)与非共址(NCL)的场景。最后,探讨了我们的掩码与局部多模态数据增强(Masking and Local Multimodal Data Augmentation, ML-MDA)策略的好处,以提升 ReID 模型对多模态损坏的鲁棒性。我们在 SYSU-MM01、RegDB 和 ThermalWORLD 数据集的干净与受损版本上的实验表明,哪些多模态 V-I ReID 模型更有可能在真实世界运行条件下表现良好。特别地,我们的 ML-MDA 是 V-I 行人 ReID 系统在处理受损多模态图像时维持高准确率与鲁棒性的重要策略。此外,我们的多模态 ReID 模型 MMSF 在 CL 与 NCL 相机场景下均优于所有方法。

关键词

引用

@article{arxiv.2305.00320,
  title  = {Fusion for Visual-Infrared Person ReID in Real-World Surveillance Using Corrupted Multimodal Data},
  author = {Arthur Josi and Mahdi Alehdaghi and Rafael M. O. Cruz and Eric Granger},
  journal= {arXiv preprint arXiv:2305.00320},
  year   = {2023}
}

备注

31 pages, 11 figures, First version submitted to IJCV journal