ORSO:通过在线奖励选择与策略优化加速奖励设计
机器学习
2025-02-26 v3 人工智能
机器人学
摘要
奖励塑形在强化学习 (RL) 中至关重要,尤其是对于稀疏奖励可能阻碍学习的复杂任务。然而,从一组奖励函数中选择有效的塑形奖励且在计算上高效 remains an open challenge。我们提出了一种名为 Online Reward Selection and Policy Optimization (ORSO) 的新方法,将塑形奖励函数的选择框架为一种在线模型选择问题。ORSO 在不需人工干预的情况下自动识别表现良好的塑形奖励函数,并具备可证明的 regret 保证。我们在 various continuous control tasks 上展示了 ORSO 的有效性。与先前方法相比,ORSO 显著减少了评估塑形奖励函数所需的数据量,实现了更高的数据效率和显著的计算时间缩减(最高可达 8 倍)。ORSO 持续识别出优于先前方法 50% 以上的高质量奖励函数,并平均识别出的策略表现与使用领域专家手动工程化奖励函数所学习的策略相当。
引用
@article{arxiv.2410.13837,
title = {ORSO: Accelerating Reward Design via Online Reward Selection and Policy Optimization},
author = {Chen Bo Calvin Zhang and Zhang-Wei Hong and Aldo Pacchiano and Pulkit Agrawal},
journal= {arXiv preprint arXiv:2410.13837},
year = {2025}
}