将视觉语言模型用作人机交互中社会智能的代理
机器人学
2025-12-09 v1
摘要
在日常环境中运行的机器人经常需要决定何时以及是否与人互动,但此类决策往往依赖于随时间展开的微妙非语言线索,而这些线索难以显式建模。基于在大学咖啡馆中部署移动服务机器人的五天 Wizard-of-Oz 实验,我们分析了人们如何通过非语言行为信号交互准备状态,以及专家巫师如何利用这些线索引导交互。受这些观察的启发,我们提出了一种两阶段流水线,其中轻量级感知检测器(注视转移和空间关系学)用于在具有社会意义的时刻选择性地触发更重的基于视频的视觉语言模型(VLM)查询。我们在重放的现场交互上评估了该流水线,并比较了两种提示策略。我们的结果表明,选择性地将 VLM 用作社会推理的代理能够实现社交响应式的机器人行为,使机器人能够通过关注人们在真实互动中自然提供的线索来做出适当的行为。
引用
@article{arxiv.2512.07177,
title = {Using Vision-Language Models as Proxies for Social Intelligence in Human-Robot Interaction},
author = {Fanjun Bu and Melina Tsai and Audrey Tjokro and Tapomayukh Bhattacharjee and Jorge Ortiz and Wendy Ju},
journal= {arXiv preprint arXiv:2512.07177},
year = {2025}
}