中文

DoughNet:面向可变形物体拓扑操作的视觉预测模型

计算机视觉与模式识别 2024-04-22 v1 机器学习 机器人学

摘要

对诸如面团等弹塑性物体的操作通常涉及拓扑变化,如分裂与合并。准确预测特定操作可能引发的这些拓扑变化,对于规划与弹塑性物体的交互至关重要。我们提出了 DoughNet,一种基于 Transformer 的架构来应对这些挑战,它由两个组件组成。首先,一个去噪自编码器将具有不同拓扑结构的可变形物体表示为潜在编码集合。其次,一个视觉预测模型执行自回归集合预测,纯粹在潜在空间中确定长时序几何形变和拓扑变化。给定部分初始状态和期望的操作轨迹,它能推断出每一步产生的所有物体几何形状和拓扑。DoughNet 从而允许规划机器人操作;选择合适的工具、其姿态和张开宽度,以重现机器人或人类设定的目标。我们在模拟和真实环境中的实验表明,DoughNet 能够显著优于仅将形变视为几何变化的现有相关方法。

关键词

引用

@article{arxiv.2404.12524,
  title  = {DoughNet: A Visual Predictive Model for Topological Manipulation of Deformable Objects},
  author = {Dominik Bauer and Zhenjia Xu and Shuran Song},
  journal= {arXiv preprint arXiv:2404.12524},
  year   = {2024}
}

备注

Under review. 17 pages, 14 figures