AlignFreeNet:可见-红外目标检测中是否存在跨模态预对齐的必要性?一种无对齐轻量级网络
计算机视觉与模式识别
2025-12-29 v2
摘要
跨模态错位问题,如空间偏移、分辨率不一致和语义缺失,经常发生在可见-红外目标检测(VI-OD)中。为缓解此问题,现有方法通常采用基于对齐的融合范式,在跨模态融合前插入显式的像素级或特征级对齐模块。然而,像素级对齐难以应对严重或混合错位,而特征级对齐在此类条件下常会引入不良噪声,最终限制检测性能。本文提出一种新颖的无对齐网络(AlignFreeNet)用于VI-OD。不同于先前方法,AlignFreeNet摒弃任何显式对齐,转而采用无对齐融合范式。具体而言,AlignFreeNet由两个核心模块组成:变异引导的跨模态补偿(VCC)和频率引导的跨模态融合(FCF)。VCC自适应地将从跨模态差异中获得的补偿信息反馈到每个模态,从而在不引入显式对齐噪声的前提下增强可见和红外表征。FCF通过抑制任务无关的冗余信息实现稳健的跨模态融合,有效缓解了融合过程中的噪声。此外,VCC与FCF共同利用低频和高频线索,保留融合表征中的前景轮廓,有效缓解严重混合错位导致的跨模态混合。广泛的在DVTOD、M3FD和DroneVehicle上的评估表明,在严重混合错位条件下,我们的AlignFreeNet实现了最先进的性能,凸显了其鲁棒性和广泛性。
引用
@article{arxiv.2507.20146,
title = {AlignFreeNet: Is Cross-Modal Pre-Alignment Necessary? An End-to-End Alignment-Free Lightweight Network for Visible-Infrared Object Detection},
author = {Dingkun Zhu and Haote Zhang and Lipeng Gu and Wuzhou Quan and Fu Lee Wang and Honghui Fan and Jiali Tang and Haoran Xie and Xiaoping Zhang and Mingqiang Wei},
journal= {arXiv preprint arXiv:2507.20146},
year = {2025}
}