CrossVL:面向跨视角视觉-语言检测的复杂度感知特征路由与配对课程学习
计算机视觉与模式识别
2026-05-12 v1 人工智能
机器学习
摘要
视觉语言模型(VLM)支持文本引导的目标检测,但在跨视角场景下性能严重下降,此时地面视角与空中视角在高度、尺度和空间布局上存在差异。这些几何变化在视角间引入了系统性的复杂度变化,例如地面视角图像包含密集且高度遮挡的结构,而空中图像则稀疏且全局有序。固定的 VLM 融合机制无法处理这种差异。我们提出了 CrossVL,一个结合复杂度感知路径聚合(CPA)与配对课程学习(PCL)的框架,以增强 VLM 的跨视角检测能力。CPA 从多模态统计中估计场景复杂度,并通过多条路径路由视觉特征以获取特定视角的表示。PCL 利用同步的地面-空中图像对的语义一致性来提供稳定的早期监督,随后逐渐过渡到随机采样。在 MAVREC 上,CrossVL 将 Florence-2 的空中 mAP 从 58.66% 提升至 61.03%,并将地面-空中性能差距从 8.63pp 缩小至 6.65pp,同时在不同随机种子下实现了 3.3 倍的方差降低。CPA 提供稳定的复杂度感知特征聚合,PCL 增强了优化动态。两者结合表明,协调的架构与训练适应对于鲁棒的跨视角 VLM 检测至关重要。
引用
@article{arxiv.2605.09802,
title = {CrossVL: Complexity-Aware Feature Routing and Paired Curriculum for Cross-View Vision-Language Detection},
author = {Zhipeng Liu and Chunbo Luo},
journal= {arXiv preprint arXiv:2605.09802},
year = {2026}
}
备注
Accepted to CVPR 2026. Code available at https://github.com/1nyourlife/Crossvl_cvpr2026