利用张量分解借助跨模态知识解决数据受限的红外目标检测
计算机视觉与模式识别
2023-09-29 v1 机器学习
摘要
在红外(IR)图像中获得良好识别性能的主要瓶颈在于缺乏足够的标注训练数据,这归因于此类数据的获取成本。鉴于 RGB 模态的目标检测方法已相当鲁棒(至少对一些常见类别,如人、汽车等而言,得益于存在海量训练集),本文致力于利用 RGB 模态的线索将目标检测器扩展到 IR 模态,同时在 RGB 模态保持模型性能。我们方法的核心是一种称为 TensorFact 的新型张量分解方法,其将卷积神经网络(CNN)某一层的卷积核拆分为低秩因子矩阵,参数量少于原始 CNN。我们首先在 RGB 模态上预训练这些因子矩阵(假定存在大量训练数据),然后仅增加少量可训练参数用于 IR 模态训练以避免过拟合,同时促使它们从仅在 RGB 模态上训练的矩阵中捕获互补线索。我们通过实验验证方法:先评估 TensorFact 分解网络在 RGB 图像目标检测任务上相对原始网络的表现,再考察其对 FLIR ADAS v1 数据集 IR 图像的适应能力。对于后者,我们在数据匮乏导致挑战的场景下训练模型。实验观察到:(i) TensorFact 在 RGB 图像上展现性能提升;(ii) 进一步,该预训练模型微调后在 FLIR ADAS v1 数据集上以约 4% 的 mAP 50 分数优于标准 SOTA 目标检测器。
引用
@article{arxiv.2309.16592,
title = {Tensor Factorization for Leveraging Cross-Modal Knowledge in Data-Constrained Infrared Object Detection},
author = {Manish Sharma and Moitreya Chatterjee and Kuan-Chuan Peng and Suhas Lohit and Michael Jones},
journal= {arXiv preprint arXiv:2309.16592},
year = {2023}
}
备注
Accepted to ICCV 2023, LIMIT Workshop. The first two authors contributed equally