通过标量化多目标强化学习中奖励函数插值预测最优值函数
机器学习
2020-03-04 v4 机器人学
机器学习
摘要
多目标强化学习(MORL)问题中定义奖励函数的一种常见方法是多个目标的加权和。这些权重随后被视为依赖于执行学习者的专业知识(与偏好)的设计参数,典型结果是权重任何变动都需新的解。本文研究 MORL 中奖励函数与最优值函数之间的关系;具体解决如何在实际求解所用权重集合之外良好近似最优值函数的问题,从而避免针对任何特定选择重新计算。我们证明给定奖励函数权重的变换(从而在策略空间中的平滑插值),值函数平滑变换。我们使用高斯过程对三个著名例子——GridWorld、Objectworld 与 Pendulum——的最优值函数在奖励函数权重上获得平滑插值。结果显示该插值能为离散与连续域问题中的样本状态与动作空间提供非常鲁棒的值。在自动驾驶领域利用此插值技术带来显著优势:驾驶时用户偏好的轻松即时适配,以及训练期间障碍车辆行为偏好的真正随机化。
引用
@article{arxiv.1909.05004,
title = {Predicting optimal value functions by interpolating reward functions in scalarized multi-objective reinforcement learning},
author = {Arpan Kusari and Jonathan P. How},
journal= {arXiv preprint arXiv:1909.05004},
year = {2020}
}
备注
Accepted at ICRA 2020