中文

基于视觉语言驱动的强化学习框架用于无人机野火追踪——构建于物理驱动的火灾数字孪生体

机器人学 2026-01-08 v1

摘要

野火监测需要具备在极端视觉退化、快速演化的物理动态以及稀缺真实训练数据条件下进行推理的自主系统。现有无人机导航方法依赖简化仿真器和监督式感知管线,缺乏在物理真实火灾环境中进行交互式感知的具身智能体。我们引入FIRE-VLM——首个基于视觉语言模型(VLM)导向的强化学习(RL)框架,全部在高保真、物理驱动的野火数字孪生体中训练。该孪生体基于USGS数字高程模型(DEM)地形、LANDFIRE燃料清单及准物理火势蔓延求解器构建,模拟地形诱导的火势、风力驱动的加速、烟雾遮蔽及动态燃料消耗。于该环境中,一个基于PPO的智能体配备双视角无人机感知,由CLIP式VLM引导。野火专用语义对齐得分来源于描述活火和烟雾喷流的单一提示词,整合为基于潜在的奖励塑形信号。我们的贡献包括:(1)构建野火数字孪生体的GIS至仿真管线;(2)面向无人机火前追踪的VLM导向RL智能体;(3)结合物理术语与VLM语义的野火感知奖励设计。在五个数字孪生评估任务中,我们的VLM导向策略将检测时间缩短最高可达6倍,提升视场内时间,是目前已知在千米尺度、物理驱动野火数字孪生体中实现的首个RL式无人机野火监测系统。

关键词

引用

@article{arxiv.2601.03449,
  title  = {FIRE-VLM: A Vision-Language-Driven Reinforcement Learning Framework for UAV Wildfire Tracking in a Physics-Grounded Fire Digital Twin},
  author = {Chris Webb and Mobin Habibpour and Mayamin Hamid Raha and Ali Reza Tavakkoli and Janice Coen and Fatemeh Afghah},
  journal= {arXiv preprint arXiv:2601.03449},
  year   = {2026}
}