基于流匹配基石模型的少样本 LoRA 适配用于跨光谱目标检测
计算机视觉与模式识别
2026-01-09 v1 人工智能
摘要
视觉基石模型主要在 RGB 数据上进行训练,而许多安全关键应用依赖非可见模态,如红外 (IR) 和合成孔径雷达 (SAR)。我们研究了单一流匹配基石模型是否可以通过仅少量配对样本即可被重用为跨光谱翻译器,并且所生成的合成数据是否能提升下游检测性能。我们基于 FLUX.1 Kontext 插入低秩适配 (LoRA) 模块,在仅每个领域 100 张配对图像上进行微调,分别针对 KAIST 数据集上的 RGB 到 IR 和 M4-SAR 数据集上的 RGB 到 SAR 两种设置。适配后的模型将 RGB 图像翻译为像素对齐的 IR/SAR,使我们能够复用现有的边界框,仅在目标模态中训练目标检测模型。在 LoRA 超参数的网格搜索中,我们发现仅基于 50 张保留样本计算的 LPIPS 是下游性能的强有力指标:更低的 LPIPS 持续预测在 YOLOv11n 上在 IR 和 SAR 上,以及在 KAIST IR 测试数据上的 DETR 上具有更高的 mAP。使用最佳 LPIPS 选定的 LoRA 适配器,来自外部 RGB 数据集 (LLVIP、FLIR ADAS) 的合成 IR 可提升 KAIST IR 步行者检测,合成 SAR 在结合有限真实 SAR 时显著提升 M4-SAR 基础设施检测。我们的结果表明,基于流匹配基石模型的少样本 LoRA 适配是支撑非可见模态的基石式方法的有前景的路径。
引用
@article{arxiv.2601.04381,
title = {Few-Shot LoRA Adaptation of a Flow-Matching Foundation Model for Cross-Spectral Object Detection},
author = {Maxim Clouser and Kia Khezeli and John Kalantari},
journal= {arXiv preprint arXiv:2601.04381},
year = {2026}
}