中文

SlotGNN:多目标表示与视觉动力学的无监督发现

机器人学 2023-10-10 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

使用无监督技术从视觉数据中学习多目标动力学具有挑战性,因为需要通过机器人交互学习到鲁棒的目标表示。本文提出了一个包含两种新架构的新框架:SlotTransport用于从RGB图像中发现目标表示,SlotGNN用于从RGB图像和机器人交互中预测它们的集体动力学。我们的SlotTransport架构基于槽注意力(slot attention)进行无监督目标发现,并使用特征传输机制来维持以目标为中心的表示的时间对齐。这使得发现的槽能够一致地反映多目标场景的组合。这些槽鲁棒地绑定到不同的目标,即使在严重遮挡或目标缺失情况下也是如此。我们的SlotGNN是一种新颖的基于图的无监督动力学模型,用于预测多目标场景的未来状态。SlotGNN利用从SlotTransport发现的槽学习场景的图表示,并执行关系与空间推理以在给定机器人动作条件下预测每个槽的未来外观。我们展示了SlotTransport在学习准确编码视觉和位置信息的以目标为中心特征方面的有效性。此外,我们突出了SlotGNN在下游机器人任务(包括具有挑战性的多目标重排和长期预测)中的准确性。最后,我们的无监督方法在真实世界中证明有效。仅需极少量额外数据,我们的框架就能在真实世界控制任务中鲁棒地预测槽及其相应动力学。

关键词

引用

@article{arxiv.2310.04617,
  title  = {SlotGNN: Unsupervised Discovery of Multi-Object Representations and Visual Dynamics},
  author = {Alireza Rezazadeh and Athreyi Badithela and Karthik Desingh and Changhyun Choi},
  journal= {arXiv preprint arXiv:2310.04617},
  year   = {2023}
}