用于三维空间长时程视觉生成与导航的空中世界模型
机器人学
2026-01-06 v2 人工智能
摘要
无人机(UAV)已成为强大的具身智能体。其核心能力之一是在大规模三维环境中的自主导航。然而,现有的导航策略通常针对避障和轨迹平滑度等低层目标进行优化,缺乏将高层语义纳入规划的能力。为了弥合这一差距,我们提出了 ANWM,一种空中导航世界模型,该模型根据过去的帧和动作预测未来的视觉观测,从而使智能体能够根据候选轨迹的语义合理性和导航效用来对其进行排序。ANWM 在 4 自由度(4-DoF)无人机轨迹上进行训练,并引入了一个受物理学启发的模块:未来帧投影(FFP),该模块将过去的帧投影到未来的视点以提供粗糙的几何先验。该模块缓解了远距离视觉生成中的表示不确定性,并捕捉了三维轨迹与自我中心观测之间的映射关系。实验结果表明,ANWM 在远距离视觉预测中显著优于现有的世界模型,并提高了无人机在大规模环境中的导航成功率。
引用
@article{arxiv.2512.21887,
title = {Aerial World Model for Long-horizon Visual Generation and Navigation in 3D Space},
author = {Weichen Zhang and Peizhi Tang and Xin Zeng and Fanhang Man and Shiquan Yu and Zichao Dai and Baining Zhao and Hongjin Chen and Yu Shang and Wei Wu and Chen Gao and Xinlei Chen and Xin Wang and Yong Li and Wenwu Zhu},
journal= {arXiv preprint arXiv:2512.21887},
year = {2026}
}