中文

NavThinker:用于社交导航中耦合预测与规划的动作条件化世界模型

机器人学 2026-03-19 v2

摘要

社交导航要求机器人在动态人类环境中安全行动。有效行为需要进行前瞻性思考:推理不同机器人动作下场景和行人如何演化,而不仅仅是反应当前观察。这创造了一个 coupled prediction-planning 挑战,机器人动作和人类运动相互影响。为解决此挑战,本文提出NavThinker,一个具有前瞻意识的框架,将动作条件化世界模型与基于策略的强化学习耦合。世界模型在 Depth Anything V2 patch feature 空间中运行,对未来场景几何和人类运动进行自回归预测;多头解码器随后产生未来深度图和人类轨迹,产生与可遍历性和相互作用风险一致的前瞻意识状态。关键的是,我们在DD-PPO的基础上进行训练,通过:(i)将动作条件化未来特征融合到当前观察嵌入中和:(ii)从预测的人类轨迹中进行社交奖励引导,注入世界模型的前瞻信号。在 single- 和 multi-robot Social-HM3D 实验中实现了 state-of-the-art导航成功率,并实现了对 Social-MP3D 和 Unitree Go2 真实部署的零样本迁移,验证了泛化性和实际应用性。网页:https://hutslib.github.io/NavThinker。

关键词

引用

@article{arxiv.2603.15359,
  title  = {NavThinker: Action-Conditioned World Models for Coupled Prediction and Planning in Social Navigation},
  author = {Tianshuai Hu and Zeying Gong and Lingdong Kong and XiaoDong Mei and Yiyi Ding and Qi Zeng and Ao Liang and Rong Li and Yangyi Zhong and Junwei Liang},
  journal= {arXiv preprint arXiv:2603.15359},
  year   = {2026}
}