Eyes Will Shut: 一种基于视觉地图反馈的强化学习视觉下一GPS位置预测模型
计算机视觉与模式识别
2025-08-05 v3 机器人学
摘要
下一位置预测是人类移动性研究中的一项基本任务,在交通规划、城市治理和流行病预测中具有广泛的应用。在实践中,当人类试图预测轨迹中的下一个位置时,他们通常会在脑海中将轨迹可视化在地图上,并基于道路连通性和移动趋势进行推理。然而,绝大多数现有的下一位置预测模型并不像人类那样在地图上进行推理。幸运的是,视觉-语言模型(VLM)的最新发展已展现出强大的视觉感知甚至视觉推理能力。这开辟了一种新的可能性:通过将道路网络和轨迹渲染到图像上,并利用VLM的推理能力,我们可以使模型以类人的方式进行轨迹推断。为探索这一想法,我们首先提出了一种称为视觉引导位置搜索(VGLS)的方法,该方法评估通用VLM在不修改其任何内部参数的情况下进行基于轨迹的推理的能力。基于VGLS结果的见解,我们进一步提出了我们的主要方法:VLMLocPredictor,它由两个阶段组成:在第一阶段,我们设计了两个监督微调(SFT)任务,帮助VLM理解道路网络和轨迹结构,并在此类视觉输入上获得基本的推理能力。在第二阶段,我们引入了基于视觉地图反馈的强化学习,使模型能够通过与环境的交互来自我提升其下一位置预测能力。在来自四个不同城市的数据集上进行的实验表明,我们的方法达到了最先进的(SOTA)性能,并且与其他基于LLM的方法相比,表现出优越的跨城市泛化能力。
引用
@article{arxiv.2507.18661,
title = {Eyes Will Shut: A Vision-Based Next GPS Location Prediction Model by Reinforcement Learning from Visual Map Feed Back},
author = {Ruixing Zhang and Yang Zhang and Tongyu Zhu and Leilei Sun and Weifeng Lv},
journal= {arXiv preprint arXiv:2507.18661},
year = {2025}
}