深度强化学习中学习奖励以优化全局性能指标
机器学习
2023-03-17 v1
摘要
当将强化学习(RL)应用于新问题时,奖励工程是系统设计者必须面对的必要但往往困难且易出错的任务。为避免这一步骤,我们提出 LR4GPM,一种新颖的(深度)RL 方法,可优化作为问题描述一部分而应可用的全局性能指标。LR4GPM 在两个阶段之间交替:(1)学习用于拟合性能指标的(可能为向量的)奖励函数;(2)训练策略以基于所学奖励优化该性能指标的近似。此类 RL 训练并非易事,因为奖励函数与策略均使用非平稳数据进行训练。为克服该问题,我们提出了若干训练技巧。我们在多个领域展示了 LR4GPM 的有效性。值得注意的是,LR4GPM 优于 DAI'2020 组织的近期自动驾驶竞赛的冠军。
引用
@article{arxiv.2303.09027,
title = {Learning Rewards to Optimize Global Performance Metrics in Deep Reinforcement Learning},
author = {Junqi Qian and Paul Weng and Chenmien Tan},
journal= {arXiv preprint arXiv:2303.09027},
year = {2023}
}