中文

利用无标签数据实现反馈高效的基于人类偏好的强化学习

机器人学 2023-02-20 v1 人工智能

摘要

基于偏好的强化学习已展现出很大前景,可利用人对查询轨迹对的二元反馈来恢复人在回路(HiL)中的潜在奖励模型。尽管已有工作试图更好地利用向人类发出的查询,本工作中我们对智能体收集的无标签轨迹提出两点观察,并给出两个相应的损失函数,以确保无标签轨迹参与奖励学习过程,并构造奖励模型的嵌入空间使其反映状态空间相对于动作距离的结构。我们在一个运动领域与一个机器人操作任务上验证了所提方法,并与最先进基线 PEBBLE 比较。我们进一步给出了所提损失分量在两个领域的消融实验,发现不仅每个损失分量均优于基线,而且二者协同组合具有好得多的奖励恢复与人类反馈样本效率。

关键词

引用

@article{arxiv.2302.08738,
  title  = {Exploiting Unlabeled Data for Feedback Efficient Human Preference based Reinforcement Learning},
  author = {Mudit Verma and Siddhant Bhambri and Subbarao Kambhampati},
  journal= {arXiv preprint arXiv:2302.08738},
  year   = {2023}
}

备注

R2HCAI, AAAI 2023