利用人类反馈进行迭代奖励塑形以纠正奖励误指定
人工智能
2023-08-31 v1
摘要
定义良好的奖励函数对于强化学习(RL)智能体的成功训练至关重要。然而,定义合适的奖励函数是一项出了名的挑战性任务,尤其在复杂的多目标环境中。开发者往往不得不从初始的、可能误指定的奖励函数入手,并根据观察到的学习行为迭代调整其参数。在本工作中,我们旨在通过提出 ITERS 来自动化这一过程,这是一种利用人类反馈进行迭代奖励塑形以缓解误指定奖励函数影响的方法。我们的方法允许用户在训练期间提供关于智能体行为的轨迹级反馈,该反馈可作为奖励塑形信号整合进后续训练迭代中。我们还允许用户提供其反馈的解释,这些解释被用于增强反馈并减少用户负担与反馈频率。我们在三种环境中评估了 ITERS,并表明其能成功纠正误指定的奖励函数。
引用
@article{arxiv.2308.15969,
title = {Iterative Reward Shaping using Human Feedback for Correcting Reward Misspecification},
author = {Jasmina Gajcin and James McCarthy and Rahul Nair and Radu Marinescu and Elizabeth Daly and Ivana Dusparic},
journal= {arXiv preprint arXiv:2308.15969},
year = {2023}
}
备注
7 pages, 2 figures