利用次优数据进行人在回路的强化学习
机器学习
2025-04-09 v2 人工智能
机器人学
摘要
为了创建有用的强化学习(RL)智能体,第一步是设计一个合适的奖励函数来捕捉任务的细微差别。然而,奖励工程可能是一个困难且耗时的过程。相反,人在回路的 RL 方法有望从人类反馈中学习奖励函数。尽管最近取得了成功,但许多人在回路的 RL 方法仍然需要大量的人类交互才能学习到成功的奖励函数。为了提高人在回路的 RL 方法的反馈效率(即需要更少的人类交互),本文引入了次优数据预训练(Sub-optimal Data Pre-training, SDP),这是一种利用无奖励的次优数据来改进基于标量和基于偏好的 RL 算法的方法。在 SDP 中,我们首先用最小环境奖励对所有低质量数据进行伪标记。通过这一过程,我们获得了奖励标签来预训练我们的奖励模型,而无需人类标记或偏好。这个预训练阶段为奖励模型的学习提供了先发优势,使其能够识别出低质量的转换应被分配低奖励。通过使用模拟和人类教师进行的大量实验,我们发现 SDP 在各种模拟机器人任务中至少能够达到,且通常会显著提升最先进的人在回路 RL 的性能。
引用
@article{arxiv.2405.00746,
title = {Leveraging Sub-Optimal Data for Human-in-the-Loop Reinforcement Learning},
author = {Calarina Muslimani and Matthew E. Taylor},
journal= {arXiv preprint arXiv:2405.00746},
year = {2025}
}