GATSBI:以智能体为中心的生成式时空物体交互
计算机视觉与模式识别
2021-04-12 v1 机器学习
机器人学
摘要
我们提出 GATSBI,一种生成式模型,可将原始观测序列转换为结构化潜表示,充分捕捉智能体动作的时空上下文。在基于视觉的决策场景中,智能体面临复杂的多维观测,其中多个实体彼此交互。智能体需要良好的视觉观测场景表示,以辨别关键组件并沿时间范围一致传播。我们的方法 GATSBI 利用无监督以物体为中心的场景表示学习,分离主动智能体、静态背景与被动物体。GATSBI 随后建模反映分解实体间因果关系的交互,并预测物理合理的未来状态。我们的模型泛化至多种环境,其中不同类型机器人与物体动态交互。我们展示 GATSBI 在场景分解与视频预测上相比其最先进对手取得更优性能。
引用
@article{arxiv.2104.04275,
title = {GATSBI: Generative Agent-centric Spatio-temporal Object Interaction},
author = {Cheol-Hui Min and Jinseok Bae and Junho Lee and Young Min Kim},
journal= {arXiv preprint arXiv:2104.04275},
year = {2021}
}
备注
accepted to CVPR'2021 as an oral presentation. Code and video will be released soon