RGBT-Ground 基准:复杂真实场景中超越 RGB 的视觉定位
计算机视觉与模式识别
2026-01-01 v1
摘要
视觉定位(VG)旨在根据自然语言表达定位图像中的特定对象,是视觉-语言理解中的一项基础任务。然而,现有的 VG 基准大多源自于在干净环境(如 COCO)下收集的数据集,场景多样性有限。因此,它们无法反映真实世界条件的复杂性,例如光照、天气等变化,而这些变化对于评估模型在安全关键应用中的鲁棒性和泛化能力至关重要。为了解决这些局限性,我们提出了 RGBT-Ground,这是第一个为复杂真实场景构建的大规模视觉定位基准。它由空间对齐的 RGB 和热红外(TIR)图像对组成,并配有高质量的指代表达、对应的物体边界框以及场景、环境和物体级别的细粒度标注。该基准能够实现全面评估,并促进在多样且具有挑战性的条件下鲁棒定位的研究。此外,我们建立了一个统一的视觉定位框架,支持单模态(RGB 或 TIR)和多模态(RGB-TIR)视觉输入。基于此,我们提出了 RGBT-VGNet,一个简单而有效的基线模型,用于融合互补的视觉模态以实现鲁棒定位。我们在 RGBT-Ground 上对现有方法进行了广泛的适配。实验结果表明,我们提出的 RGBT-VGNet 显著优于这些适配方法,尤其是在夜间和远距离场景中。所有资源将公开发布,以促进未来在复杂真实环境中鲁棒视觉定位的研究。
引用
@article{arxiv.2512.24561,
title = {RGBT-Ground Benchmark: Visual Grounding Beyond RGB in Complex Real-World Scenarios},
author = {Tianyi Zhao and Jiawen Xi and Linhui Xiao and Junnan Li and Xue Yang and Maoxun Yuan and Xingxing Wei},
journal= {arXiv preprint arXiv:2512.24561},
year = {2026}
}
备注
27pages, 9figures