VLC Fusion:面向环境感知的视觉语言条件传感器融合以提升目标检测鲁棒性
计算机视觉与模式识别
2025-05-20 v1
摘要
虽然融合多种传感器模态可以提升目标检测性能,但现有融合方法常忽视环境条件和传感器输入的细微差异,导致无法在此类差异下自适应调整各模态的权重。为此,我们引入视觉语言条件融合(VLC Fusion)——一种新型融合框架,利用视觉语言模型(VLM)根据细微的环境线索来引导融合过程。通过捕获诸如黑暗、雨雾和相机模糊等高层次环境上下文,VLM 可根据当前场景动态调整模态权重。我们在包含图像、激光雷达和中波红外三种模态的真实世界自动驾驶和军事目标检测数据集上进行评估。实验表明,VLC Fusion 在所有常规融合基线上均表现出色,在看见和未看见的场景中均实现检测精度的提升。
引用
@article{arxiv.2505.12715,
title = {VLC Fusion: Vision-Language Conditioned Sensor Fusion for Robust Object Detection},
author = {Aditya Taparia and Noel Ngu and Mario Leiva and Joshua Shay Kricheli and John Corcoran and Nathaniel D. Bastian and Gerardo Simari and Paulo Shakarian and Ransalu Senanayake},
journal= {arXiv preprint arXiv:2505.12715},
year = {2025}
}
备注
12 pages, 19 figures