中文

INTENTION:通过交互直觉和以 grounding VLM 推断人类oid机器人运动倾向

机器人学 2025-08-08 v1 人工智能

摘要

传统的机器人操作控制和规划方法依赖于精确的物理模型和预定义的动作序列。虽然在结构化环境中有效,但这些方法常因建模不准确而失败,难以泛化到新任务。相比之下,人类会直观地与周围环境交互,展现出惊人的适应性,通过隐式的物理理解做出高效决策。在本工作中,我们提出了INTENTION框架,使具备学习的交互直觉和在多样场景中进行自主操作的机器人能够通过集成基于视觉语言模型(VLM)的场景推理与交互驱动的记忆来实现。我们引入记忆图(Memoy Graph)来记录之前任务交互的场景,体现了对不同任务在真实世界中进行的人类式理解和决策。同时,我们设计了直观感知器(Intuitive Perceptor),从视觉场景中提取物理关系和可行性。通过这些组件,机器人能够在不依赖重复指令的情况下推断出在新场景中合适的交互行为。视频:https://robo-intention.github.io

关键词

引用

@article{arxiv.2508.04931,
  title  = {INTENTION: Inferring Tendencies of Humanoid Robot Motion Through Interactive Intuition and Grounded VLM},
  author = {Jin Wang and Weijie Wang and Boyuan Deng and Heng Zhang and Rui Dai and Nikos Tsagarakis},
  journal= {arXiv preprint arXiv:2508.04931},
  year   = {2025}
}

备注

Project Web: https://robo-intention.github.io