Social-LLaVA:通过社交空间中的人类语言推理增强机器人导航
计算机视觉与模式识别
2025-01-17 v1 人机交互
机器人学
摘要
大多数现有社交机器人导航技术要么利用手工制作的规则或人类演示来连接机器人感知与社交合规动作。然而,在有效地将感知转化为社交合规动作方面,仍存在显著的鸿沟,这种情况类似于人类在动态环境中自然发生的推理。鉴于视觉语言模型(Vision-Language Models, VLM)近期的成功,我们提出使用语言作为感知与社交意识机器人动作之间人类推理的桥梁。我们创建了一个视觉语言数据集,名为 Social robot Navigation via Explainable Interactions(SNEI),包含 40K 人工标注的视觉问题答案(VQA),基于 2K 人机社交互动,涵盖感知、预测、链条推理、动作和解释,数据集涉及非结构化、拥挤的公共空间。我们对 SNEI 进行微调,训练一个 VLM,Social-LLaVA,以展示我们数据集的实际应用。Social-LLaVA 在 50 个 VQA 上的平均十五种不同人类评分指标上,超过了 GPT-4V 和 Gemini 等最先进模型。部署在移动机器人上,Social-LLaVA 使其能够进行类人推理,标志着通过语言推理在动态公共空间中实现社交合规机器人导航的重要进展。
引用
@article{arxiv.2501.09024,
title = {Social-LLaVA: Enhancing Robot Navigation through Human-Language Reasoning in Social Spaces},
author = {Amirreza Payandeh and Daeun Song and Mohammad Nazeri and Jing Liang and Praneel Mukherjee and Amir Hossain Raj and Yangzhe Kong and Dinesh Manocha and Xuesu Xiao},
journal= {arXiv preprint arXiv:2501.09024},
year = {2025}
}