基于偏好的强化学习中数据驱动的奖励初始化
机器学习
2023-02-20 v1 人工智能
摘要
基于偏好的强化学习(PbRL)方法利用人类在环(HiL)对查询轨迹对的二值反馈来学习奖励模型,试图逼近捕捉其偏好的人类潜在奖励函数。本文中,我们研究初始化奖励模型高度可变性的问题,这些模型对实验随机种子敏感。这进一步加剧了PbRL方法本已遭受的退化奖励函数问题。我们提出一种数据驱动的奖励初始化方法,不增加人类在环的任何额外成本,且对PbRL智能体成本可忽略,并表明这样做可确保初始化奖励模型的预测奖励在状态空间中均匀,从而降低该方法多次运行间性能的可变性,并相较于其他初始化方法提升了整体性能。
引用
@article{arxiv.2302.08733,
title = {Data Driven Reward Initialization for Preference based Reinforcement Learning},
author = {Mudit Verma and Subbarao Kambhampati},
journal= {arXiv preprint arXiv:2302.08733},
year = {2023}
}
备注
R2HCAI, AAAI 2023