在关键时刻思考:用于具备RL策略的社交导航的条件性VLM推理
机器人学
2026-07-13 v1 人工智能
计算机视觉与模式识别
摘要
随着移动机器人越来越融入日常人类环境,社交机器人导航对于确保人类舒适度、安全性和信任变得至关重要。虽然强化学习(RL)导航策略提供了实时部署所需的快速推理和反应行为,但它们仍然缺乏灵活的语义推理能力,并且常常无法泛化到复杂的社交场景。最近的方法越来越多地转向使用视觉语言模型(VLM)来替代RL策略,以改善机器人导航中的语义和社交推理。然而,它们的高计算成本和缓慢推理仍然是实时部署的主要障碍。为了克服这些限制,我们引入了HUMA(用于多模态社交导航的混合理解),一种混合架构,它动态平衡了RL策略的计算效率与VLM的深度语义理解。我们的方法使用反应式RL策略来处理低密度、常规的导航任务,并在人类进入敏感情况(例如机器人的接近区域)时,将其条件化于一个后训练的高层VLM。我们在Social-MP3D和Social-HM3D基准上评估了HUMA,与最先进的基线相比,任务成功率分别提高了20%和3%,同时显著减少了个人空间侵犯和与人的碰撞。广泛的消融研究验证了每个架构组件,而在Miroka"i移动机器人上的实际部署进一步证明了我们方法的实际可行性。
引用
@article{arxiv.2607.10991,
title = {Think When It Matters: Conditional VLM Reasoning for Social Navigation with RL Policies},
author = {Ali Ahmadi and Hamed Rahimi and Adrien Jacquet Cretides and Marie Samson and Mahdi Khoramshahi and Mohamed Chetouani},
journal= {arXiv preprint arXiv:2607.10991},
year = {2026}
}
备注
CoRL 2026 submission. 15 pages, 7 figures