Video2BEV:将无人机视频转换为BEV用于基于视频的地理定位
计算机视觉与模式识别
2025-07-29 v4
摘要
现有的无人机视觉地理定位方法主要采用图像基准设置,即将单个无人机视图与来自其他平台的图像进行匹配。然而,这种任务表述未充分利用无人机的天然视频输出,且对遮挡和视点差异敏感。为解决这些限制,我们提出了新的基于视频的无人机地理定位任务,并构建Video2BEV范式。该范式将视频转换为鸟瞰视图(BEV),从而简化后续的跨平台匹配过程。具体而言,我们采用高斯溅射(Gaussian Splatting)重建3D场景并获得BEV投影。与现有变换方法(如极坐标变换)不同,我们的BEV保留了更多细粒度细节且无显著畸变。为促进判别性内部分表示学习,我们的Video2BEV范式还包含一个基于扩散模型的模块,用于生成硬性负样本。为验证我们的方法,我们引入UniV,一个新的基于视频的地理定位数据集,扩展了基于图像的University-1652数据集。UniV特点是以和仰角飞行的路径,帧率提升至每秒最高10帧(FPS)。在UniV数据集上的大量实验表明,我们的Video2BEV范式实现了竞争性的召回率,并优于常规基于视频的方法。与其他竞争方法相比,我们的方法在较低仰角下更具鲁棒性,遮挡更严重。
引用
@article{arxiv.2411.13610,
title = {Video2BEV: Transforming Drone Videos to BEVs for Video-based Geo-localization},
author = {Hao Ju and Shaofei Huang and Si Liu and Zhedong Zheng},
journal= {arXiv preprint arXiv:2411.13610},
year = {2025}
}