面向目标检测适应的模态翻译而不遗忘先验知识
计算机视觉与模式识别
2024-08-02 v3 人工智能
摘要
深度学习中的常见做法是在大规模数据集上训练大型神经网络,以在各种领域和任务中实现高精度。虽然这种方法在许多应用领域效果良好,但在处理来自新模态且与预训练模型所用数据存在显著分布偏移的数据时,往往彻底失败。本文专注于将在大规模RGB图像上训练的目标检测模型适应到来自红外图像的新数据,且存在显著的模态偏移。我们提出模态翻译器(ModTr)作为常见微调方法的替代方案。ModTr通过一个小型变换网络适应红外输入图像,该网络直接以最小化检测损失为目标进行训练。然后,原始RGB模型可以在翻译后的输入上工作,无需对其参数进行任何进一步更改或微调。在两个知名数据集上从红外到RGB图像的翻译实验结果表明,我们简单的方法提供了与标准微调相当或更好的检测器,且不会遗忘原始模型的知识。这为更灵活、高效的基于服务的检测流程打开了大门,其中唯一且未修改的服务器(如RGB检测器)持续运行,同时被不同模态(如红外及其对应的翻译模型)查询。我们的代码可在https://github.com/heitorrapela/ModTr获取。
引用
@article{arxiv.2404.01492,
title = {Modality Translation for Object Detection Adaptation Without Forgetting Prior Knowledge},
author = {Heitor Rapela Medeiros and Masih Aminbeidokhti and Fidel Guerrero Pena and David Latortue and Eric Granger and Marco Pedersoli},
journal= {arXiv preprint arXiv:2404.01492},
year = {2024}
}
备注
ECCV 2024: European Conference on Computer Vision, Milan Italy