面向社交感知机器人的轻量级视觉推理
机器人学
2026-03-05 v1
摘要
在共享人类环境中运行的机器人不仅要导航、交互和检测其周围环境,还必须解释和响应动态且常常不可预测的人类行为。尽管近期进展在增强机器人感知和指令跟随方面取得了显著成果,但仍受限于解决多模态人机交互 (HRI) 的复杂性。为了应对这一挑战,我们引入一种轻量级语言到视觉反馈模块,将语言模型 (LLM) 与视觉编码器中的循环连接。该模块通过门控多层感知机 (MLP) 将图像标记隐藏状态投射回编码器输入,触发第二遍对文本上下文下的场景进行重新解释。我们在三个以机器人为中心的任务上进行评估:模拟环境中的导航 (Habitat)、顺序场景描述 (Mementos-Robotics) 以及人类意图识别 (我们的 HRI 数据集)。结果表明,我们的方法使 Qwen 2.5 (7B) 减少距离 3.3%,描述得分增加 0.057,准确率提高 2.93%,且额外参数不足 3%;Gemma 3 (4B) 和 LLaVA OV 1.5 (4B) 在后两个任务上分别获得 +0.111、+0.055 和 +10.81%、+4.79% 的提升。代码可在 https://github.com/alessioGalatolo/VLM-Reasoning-for-Robotics 获取。
引用
@article{arxiv.2603.03942,
title = {Lightweight Visual Reasoning for Socially-Aware Robots},
author = {Alessio Galatolo and Ronald Cumbal and Alexandros Rouchitsas and Katie Winkle and Didem Gürdür Broo and Ginevra Castellano},
journal= {arXiv preprint arXiv:2603.03942},
year = {2026}
}
备注
ICRA26