PRISM:基于分段和跨注意力的点云重集推断用于操控
机器人学
2025-07-08 v1
摘要
鲁棒的机器人操控仿真学习需要全面的 3D 感知能力,而许多现有方法在杂乱环境中难以胜任。固定摄像视角的方法易受视角变化的影响,3D 点云技术常仅限于关键帧预测,降低了其在动态、接触密集型任务中的效能。为此,我们提出了 PRISM—an 一个作为端到端框架设计,用于直接从原始点云观察和机器人状态中学习,无需预训练模型或外部数据集。PRISM 包含三个主要组件:一个分割嵌入单元将原始点云划分为 distinct 对象 cluster 并编码局部几何细节;一个跨注意力组件将这些视觉特征与处理后的机器人关节状态融合,以突出相关目标;以及一个扩散模块将融合表示转化为平滑的机器人动作。在每个任务上进行 100 次示范性训练后,PRISM 在模拟环境中在准确性和效率方面均优于 2D 和 3D 基线策略,展示了在复杂、物体密集场景中的强鲁棒性。代码和部分演示已公开于 https://github.com/czknuaa/PRISM。
引用
@article{arxiv.2507.04633,
title = {PRISM: Pointcloud Reintegrated Inference via Segmentation and Cross-attention for Manipulation},
author = {Daqi Huang and Zhehao Cai and Yuzhi Hao and Zechen Li and Chee-Meng Chew},
journal= {arXiv preprint arXiv:2507.04633},
year = {2025}
}