基于人类反馈的机器人操作在线拒绝抽样
机器人学
2025-10-31 v1 人工智能
摘要
强化学习 (RL) 被广泛用于生产稳健的机器人操纵策略,但由于价值估计不准确以及中间步骤稀疏监督,使用 RL 对视觉语言-动作 (VLA) 模型进行精细调优可能不稳定。相比之下,imitation learning (IL) 易于训练,但由于其离线性质,往往表现不佳。本文提出了 Hi-ORS,一种简单而有效的后训练方法,利用拒绝抽样实现训练稳定性和高鲁棒性。Hi-ORS 通过在在线精细调优期间过滤掉负奖励样本来稳定价值估计,并采用奖励加权的监督训练目标以提供密集的中间步骤监督。为进行系统性研究,我们开发了一个支持灵活在线人类反馈的异步推理-训练框架,这些反馈作为学习错误恢复行为的显式指导。我们在三个真实世界任务和两个本体上,对 Hi-ORS 对 pi-base 策略进行精细调优,仅用 1.5 小时的真实世界训练即可显著优于 RL 和 IL 基线,在有效性和效率方面。值得注意的是,经过精细调优的策略在测试时表现出强大的可扩展性,能够可靠地执行复杂的错误恢复行为以实现更好的性能。
引用
@article{arxiv.2510.26406,
title = {Human-in-the-loop Online Rejection Sampling for Robotic Manipulation},
author = {Guanxing Lu and Rui Zhao and Haitao Lin and He Zhang and Yansong Tang},
journal= {arXiv preprint arXiv:2510.26406},
year = {2025}
}
备注
8 pages