分层奖励:为期望行为设计规范并加速学习的奖励设计
机器学习
2024-08-08 v3 人工智能
摘要
强化学习智能体通过与环境交互来最大化奖励信号。作为人类,我们在学习过程中的工作是设计奖励函数以表达期望行为,并使智能体能够迅速学习该行为。然而,设计良好的奖励函数以诱导期望行为通常很困难,更不用说何种奖励能使学习加快的问题。本工作中,我们引入一类称为分层奖励(Tiered Reward)的奖励结构,同时解决这两个问题。我们考虑将任务表述为到达期望状态并避免不期望状态时的奖励设计问题。首先,我们提出策略空间上的严格偏序以解决行为偏好中的权衡。我们偏好那些更快且以更高概率到达好状态、同时更久避免坏状态的策略。接下来,我们引入分层奖励,一类与环境无关的奖励函数,并证明它保证能诱导出依据我们的偏好关系为帕累托最优的策略。最后,我们证明分层奖励在多种表格型与深度强化学习算法中均能带来快速学习。
引用
@article{arxiv.2212.03733,
title = {Tiered Reward: Designing Rewards for Specification and Fast Learning of Desired Behavior},
author = {Zhiyuan Zhou and Shreyas Sundara Raman and Henry Sowerby and Michael L. Littman},
journal= {arXiv preprint arXiv:2212.03733},
year = {2024}
}
备注
For code, see https://github.com/zhouzypaul/tiered-reward