3PoinTr:用于从随意视频中机器人操纵预训练的3D点轨迹
机器人学
2026-03-10 v1
摘要
数据高效训练稳健的机器人策略是释放自动化在广泛新任务领域的关键。当前系统需要大量演示才能实现稳健性,这在许多应用中是不切实际的。直接从人类视频中学习策略是一个有前景的备选方案,消除了遥操作成本,但将挑战转向embodiment gap(机器人与人类之间运动学和策略差异),通常需要限制性且精心编排的人类动作。我们提出3PoinTr,一种从随意且不受约束的人类视频中为机器人操纵预训练的方法,使其能够从人类天然的动作中学习。3PoinTr使用Transformer架构预测3D点轨迹作为中间的embodiment-agnostic 表示。3D点轨迹编码目标规格、场景几何和时空关系。我们使用Perceiver IO架构提取紧凑的表示,即使点轨迹违反下游embodiment-specific约束,也能实现样本高效的行为克隆。我们在模拟和真实世界任务上进行了彻底的评估,发现3PoinTr在仅需20个带标记的机器人演示的情况下,即可在多样化的操纵任务类别上实现稳健的空间泛化。3PoinTr超过了基线方法,包括行为克隆方法以及从人类视频中进行预训练的先前方法。我们还对3PoinTr的3D点轨迹预测进行了评估。我们发现3PoinTr由于基于单一Transformer的轻量且具有表达力的架构,以及保留部分遮挡点 supervision 的训练公式,产生的点轨迹更准确、质量更高。项目页面:https://adamhung60.github.io/3PoinTr/。
引用
@article{arxiv.2603.08485,
title = {3PoinTr: 3D Point Tracks for Robot Manipulation Pretraining from Casual Videos},
author = {Adam Hung and Bardienus Pieter Duisterhof and Jeffrey Ichnowski},
journal= {arXiv preprint arXiv:2603.08485},
year = {2026}
}