AMPLIFY:基于动作自由运动先验的机器人视频学习
机器人学
2025-06-18 v1 计算机视觉与模式识别
机器学习
摘要
robotics 的动作标注数据稀缺且成本高昂,限制了所学策略的泛化能力。相比之下,大量无动作标签的视频数据 readily available,但将这些观察转化为有效策略仍是挑战。我们提出 AMPLIFY,一种新型框架,通过对视觉动态编码为由关键点轨迹派生的紧凑离散运动 token 来利用大规模无动作视频数据。我们的模块化方法将视觉运动预测与动作推断分离,解耦学习何种运动定义任务与机器人如何执行之难题。我们在充足的无动作视频上训练前向动态模型,在有限的动作标注示例上训练逆向动态模型,从而实现独立扩展。广泛的评估表明,所学动态模型准确性佳,在最佳情况下实现 3.7 倍更好的均方误差(MSE)和 2.5 倍以上的像素预测精度,同时也具备广泛用途。在下游策略学习中,我们的动态预测使在低数据 regime 下实现 1.2-2.2 倍的改进,学习自动作自由的人类视频实现平均 1.4 倍的提升,并首次实现从零 in-distribution 动作数据对 LIBERO 任务的泛化。除了机器人控制之外,我们发现 AMPLIFY 所学的动态模型也是一种通用且富有洞察力的潜在世界模型,提升了视频预测质量。我们的结果提出了一种新范式,利用异构数据源构建高效、通用的世界模型。更多信息可访问 https://amplify-robotics.github.io/。
引用
@article{arxiv.2506.14198,
title = {AMPLIFY: Actionless Motion Priors for Robot Learning from Videos},
author = {Jeremy A. Collins and Loránd Cheng and Kunal Aneja and Albert Wilcox and Benjamin Joffe and Animesh Garg},
journal= {arXiv preprint arXiv:2506.14198},
year = {2025}
}