Next-Future:面向机器人臂任务的样本高效策略学习
机器人学
2025-04-16 v1 计算机视觉与模式识别
机器学习
摘要
Hindsight Experience Replay (HER) 被广泛认为是实现样本高效多目标强化学习(RL)的 state-of-the-art 算法,适用于奖劵为二元的机器人操作任务。HER 通过重新定义目标来重放失败尝试的轨迹,从而实现从失败中学习。然而,它依赖基于启发式的重放方法,缺乏原则框架。为此,我们引入新颖的重放策略“Next-Future”,聚焦于奖励单步转换。该方法显著提升了在严格精度要求下学习多目标马尔可夫决策过程(MDP)的样本效率和准确性——这对于执行复杂精确的机器人臂任务至关重要。我们通过展示单步学习如何在多目标 RL 框架中改进价值近似来证明方法有效性。该方法在八个具有挑战性的机器人操作任务上进行评估,使用十个随机种子进行训练。结果表明,该方法在七个任务上实现显著的样本效率提升,并在六个任务上实现更高的成功率。此外,实际实验验证了所学策略的实际可行性,展示了“Next-Future”在解决复杂机器人臂任务方面的潜力。
引用
@article{arxiv.2504.11247,
title = {Next-Future: Sample-Efficient Policy Learning for Robotic-Arm Tasks},
author = {Fikrican Özgür and René Zurbrügg and Suryansh Kumar},
journal= {arXiv preprint arXiv:2504.11247},
year = {2025}
}
备注
10 pages, 9 figures, 6 tables