中文

PACA:面向零样本场景重排的视角感知交叉注意力表征

机器人学 2024-12-03 v2 计算机视觉与模式识别

摘要

场景重排(如整理桌面)是机器人操作中一项具有挑战性的任务,因为预测多样化的物体排列十分复杂。经过网络规模训练的生成模型(如 Stable Diffusion)可以通过生成自然场景作为目标来提供帮助。为便于机器人执行,必须提取物体级表征,以将真实场景与生成的目标进行匹配,并计算物体姿态变换。当前方法通常采用多步设计,涉及独立的生成、分割和特征编码模型,这可能导致因误差累积而成功率较低。此外,它们缺乏对生成目标视角的控制,将任务限制在 3 自由度设置中。本文提出 PACA,一种用于场景重排的零样本流程,利用从 Stable Diffusion 导出的视角感知交叉注意力表征。具体来说,我们开发了一种将生成、分割和特征编码集成到单一步骤中的表征,以产生物体级表征。此外,我们引入了视角控制,从而能够匹配 6 自由度相机视图,并扩展了以往仅限于 3 自由度俯视视图的方法。我们的方法在多种场景的真实机器人实验中展示了其零样本性能,分别取得了 87% 的平均匹配准确率和 67% 的执行成功率。

关键词

引用

@article{arxiv.2410.22059,
  title  = {PACA: Perspective-Aware Cross-Attention Representation for Zero-Shot Scene Rearrangement},
  author = {Shutong Jin and Ruiyu Wang and Kuangyi Chen and Florian T. Pokorny},
  journal= {arXiv preprint arXiv:2410.22059},
  year   = {2024}
}

备注

Accepted by WACV2025