面向用户的鲁棒强化学习
机器学习
2022-12-13 v4
摘要
近年来,提升策略在不同环境中的鲁棒性在强化学习(RL)领域引起了越来越多的关注。现有的鲁棒 RL 方法大多旨在通过优化策略在最坏情况环境中的表现来实现极大极小鲁棒性。然而,在实践中,使用 RL 策略的用户可能对其在不同环境中的表现有不同的偏好。显然,上述极大极小鲁棒性往往过于保守,无法满足用户偏好。因此,在本文中,我们将用户偏好整合到鲁棒 RL 的策略学习中,并提出了一种新颖的面向用户的鲁棒 RL(UOR-RL)框架。具体而言,我们为 RL 定义了一种新的面向用户的鲁棒性(UOR)度量,该度量根据用户偏好为不同环境分配不同权重,并推广了极大极小鲁棒性度量。为优化 UOR 度量,我们分别针对已知或未知环境先验分布的情形,开发了两种不同的 UOR-RL 训练算法。理论上,我们证明了即便对环境分布认知不准确或完全未知,我们的 UOR-RL 训练算法也能收敛到近最优策略。此外,我们在 4 个 MuJoCo 任务上进行了广泛的实验评估。实验结果表明,在平均和最坏情况性能度量下,UOR-RL 与最先进的基线相当,更重要的是,在 UOR 度量下确立了新的最先进性能。
引用
@article{arxiv.2202.07301,
title = {User-Oriented Robust Reinforcement Learning},
author = {Haoyi You and Beichen Yu and Haiming Jin and Zhaoxing Yang and Jiahui Sun},
journal= {arXiv preprint arXiv:2202.07301},
year = {2022}
}