MAction-SocialNav:基于推理增强提示调谐的多动作社会合规导航
机器人学
2025-12-29 v1
摘要
社会合规导航要求机器人在尊重社会规范的前提下,在以人为中心的环境中安全且恰当地移动。然而,社会规范往往模糊不清,在单个情景中可能存在多个 equally 可接受的动作。大多数现有方法通过假设单一正确动作来简化这一问题,限制了其处理现实社会不确定性的能力。本文提出MAction-SocialNav,一种高效视觉语言模型,用于社会合规导航,显式地解决动作模糊性,使其能够在单个情景中生成多个合理动作。为增强模型的推理能力,我们引入了一种新颖的元认知提示(MCP)方法。为评估所提方法,我们构建了一个考虑多样条件的多动作社会合规导航数据集,包括人群密度、室内外环境以及双人注释。数据集包含789个样本,每个样本包含三轮对话,随机选择后分为710个训练样本和79个测试样本。我们设计了五个评估指标来评估高层决策精度、安全性和多样性。大量实验表明,所提出的MAction-SocialNav在保持高效能的同时实现了强大的社会推理性能,凸显了其在实际人机导航中的潜力。与零-shot GPT-4o和Claude相比,我们的模型在决策质量(APG: 0.595 vs. 0.000/0.025)和安全对齐方面显著优于(ER: 0.264 vs. 0.642/0.668),同时保持实时效率(1.524 FPS,快于3倍)。
引用
@article{arxiv.2512.21722,
title = {MAction-SocialNav: Multi-Action Socially Compliant Navigation via Reasoning-enhanced Prompt Tuning},
author = {Zishuo Wang and Xinyu Zhang and Zhuonan Liu and Tomohito Kawabata and Daeun Song and Xuesu Xiao and Ling Xiao},
journal= {arXiv preprint arXiv:2512.21722},
year = {2025}
}