中文

通过效果预测联合发现物体和动作符号用于机器人操作规划

机器人学 2026-06-22 v1

摘要

为了执行复杂的操作规划,自主机器人需要将连续的、高维的感觉运动交互抽象为离散的物体和动作表示。早期的工作要么基于视觉外观对物体进行分类,这无法区分外观相似但行为不同的物体,要么基于交互下的效果进行分类,但仅限于预定义的动作。为了解决这些限制,我们提出了一种模型,通过二元瓶颈层联合发现高级操作原语和物体类别,该模型训练用于从随机交互数据预测多模态结果,包括物体运动、接触和力反馈。基于这些发现的二元表示,我们利用一种离散规划方法,该方法使用预测效果轨迹中的中间步骤来实现部分动作执行,以实现精确的低层控制。此外,我们通过将少量交互效果与学习到的物体符号的预测效果进行比较来分配物体类别,从而评估我们框架在新物体上的泛化能力,实现基于行为而非视觉相似性的少样本泛化。我们在桌面重定位和堆叠任务上进行了实验,并确认我们基于效果的规划方法在已见和新物体上的规划精度上均优于最先进的方法和基于视觉的替代方法。

关键词

引用

@article{arxiv.2607.00031,
  title  = {Joint Discovery of Object and Action Symbols through Effect Prediction for Robotic Manipulation Planning},
  author = {Burcu Kilic and Berke Kartal and Fatih Dogangun and Erhan Oztop and Emre Ugur},
  journal= {arXiv preprint arXiv:2607.00031},
  year   = {2026}
}