SlotVLA:面向机器人操作中对象关系表示建模
机器人学
2026-05-07 v3 计算机视觉与模式识别
摘要
受人类对离散对象及其关系进行推理方式的启发, 本文探讨紧凑的对象中心化及对象关系表示是否可构成多任务机器人操作的基础。大多数现有机器人多任务模型依赖稠密嵌入,这些嵌入将对象与背景线索纠缠, 引发效率和可解释性方面的顾虑。相反, 本文将对象关系中心化表示作为实现更结构化、更高效及更可解释视觉-运动控制的路径。本文的贡献有两方面:其一, 本文引入LIBERO+, 一个细粒度基准数据集,旨在启用和评估机器人操作中的对象关系推理。不同于先前数据集, LIBERO+提供对象中心化标注, 将演示丰富化为框级和掩模级标签以及实例级时序跟踪, 支持紧凑且可解释的视觉-运动表示。其二, 本文提出SlotVLA, 一种基于slot注意力的框架, 用于捕捉对象及其关系以进行动作解码。它采用基于slot的视觉记号化器以维持一致的时序对象表示, 采用关系中心化解码器生成任务相关嵌入, 并引入由LLM驱动的模块将这些嵌入转化为可执行动作。LIBERO+上的实验表明, 对象中心化slot和对象关系slot表示显著减少所需的视觉标记数量, 同时实现可竞争的泛化。综上, LIBERO+与SlotVLA为推进以对象关系为中心的机器人操作提供了紧凑、 可解释且有效的基础。
引用
@article{arxiv.2511.06754,
title = {SlotVLA: Towards Modeling of Object-Relation Representations in Robotic Manipulation},
author = {Taisei Hanyu and Nhat Chung and Huy Le and Toan Nguyen and Yuki Ikebe and Anthony Gunderman and Duy Nguyen Ho Minh and Khoa Vo and Tung Kieu and Kashu Yamazaki and Chase Rainwater and Anh Nguyen and Ngan Le},
journal= {arXiv preprint arXiv:2511.06754},
year = {2026}
}
备注
Accepted at ICRA 2026