SARM:长期机器人操作的阶段感知奖励建模
机器人学
2026-04-28 v4
摘要
大规模机器人学习在复杂操作任务上取得了进展,但由于演示质量不一致,长期 horizons 且具有接触特性的问题(尤其是涉及可变形物体的问题)仍具有挑战性。我们提出了一种基于阶段感知的、基于视频的奖励建模框架,联合预测任务阶段和细粒度进度,使用自然语言子任务注释从而在可变长度演示中获得一致的标签。这避免了基于帧索引的标签方法的脆弱性,即使在像 T 恤折叠这样的任务中也能提供稳定的监督。我们的奖励模型对演示变异性具有鲁棒性,能够推广到超出分布的场景,并改进下游策略训练。基于此,我们引入了奖励对齐行为克隆(RA-BC),其根据奖励估计过滤和重新权重演示。实验表明,我们的方法在实际操作和人类验证中均显著优于基线方法。在 T 恤折叠任务中,分别从平整状态和皱卷状态取得 83% 和 67% 的成功率,而传统 BC 仅为 8% 和 0%。总体而言,我们的结果突显了奖励建模作为长期机器人操作的可扩展且注释高效解决方案。项目网站:https://qianzhong-chen.github.io/sarm.github.io/
引用
@article{arxiv.2509.25358,
title = {SARM: Stage-Aware Reward Modeling for Long Horizon Robot Manipulation},
author = {Qianzhong Chen and Justin Yu and Mac Schwager and Pieter Abbeel and Yide Shentu and Philipp Wu},
journal= {arXiv preprint arXiv:2509.25358},
year = {2026}
}