CARMA:将视觉语言模型与目标与动作识别结合用于人机群体交互情境感知
机器人学
2025-06-26 v1 人工智能
人机交互
摘要
我们提出了CARMA系统,用于人机群体交互中的情境感知。有效的群体环境协作需要基于对当前人员和对象的一致表示,以及关于行为者和被操纵对象事件的情节抽象而实现情境意识。这要求对实例进行清晰且一致的分配,确保机器人正确识别和跟踪行为者、对象及其随时间变化的相互作用。为实现这一点,CARMA唯一标识物理世界中此类实体的实例,并将其组织为行为者、对象和动作的锚定三元组。为验证我们的方法,我们进行了三项实验,其中多名人类与机器人进行交互:协作倒水、传递和分类。这些情景允许评估系统在角色区分、多行为者意识和一致实例识别方面的能力。我们的实验表明,系统能够可靠地生成准确的行为者-动作-对象三元组,为需要时空推理和 Situated决策的应用提供结构化且稳健的基础。
引用
@article{arxiv.2506.20373,
title = {CARMA: Context-Aware Situational Grounding of Human-Robot Group Interactions by Combining Vision-Language Models with Object and Action Recognition},
author = {Joerg Deigmoeller and Stephan Hasler and Nakul Agarwal and Daniel Tanneberg and Anna Belardinelli and Reza Ghoddoosian and Chao Wang and Felix Ocker and Fan Zhang and Behzad Dariush and Michael Gienger},
journal= {arXiv preprint arXiv:2506.20373},
year = {2025}
}