中文

基于偏好的强化学习中数据驱动的奖励初始化

机器学习 2023-02-20 v1 人工智能

摘要

基于偏好的强化学习(PbRL)方法利用人类在环(HiL)对查询轨迹对的二值反馈来学习奖励模型,试图逼近捕捉其偏好的人类潜在奖励函数。本文中,我们研究初始化奖励模型高度可变性的问题,这些模型对实验随机种子敏感。这进一步加剧了PbRL方法本已遭受的退化奖励函数问题。我们提出一种数据驱动的奖励初始化方法,不增加人类在环的任何额外成本,且对PbRL智能体成本可忽略,并表明这样做可确保初始化奖励模型的预测奖励在状态空间中均匀,从而降低该方法多次运行间性能的可变性,并相较于其他初始化方法提升了整体性能。

关键词

引用

@article{arxiv.2302.08733,
  title  = {Data Driven Reward Initialization for Preference based Reinforcement Learning},
  author = {Mudit Verma and Subbarao Kambhampati},
  journal= {arXiv preprint arXiv:2302.08733},
  year   = {2023}
}

备注

R2HCAI, AAAI 2023