中文

通往目标的面包屑:基于人在回路反馈的目标条件探索

机器学习 2023-07-21 v1 人工智能 机器人学

摘要

探索与奖励设定是强化学习的基本且相互交织的挑战。解决需要广泛探索的序贯决策任务,要么需要精心设计的奖励函数,要么需要使用寻求新颖性的探索奖励。人类监督者可以在回路中提供有效指导以引导探索过程,但先前利用此类指导的方法需要持续同步的高质量人类反馈,这代价高昂且难以获取。本工作中,我们提出一种称为人类引导探索(HuGE)的技术,它使用来自非专家用户的低质量反馈,这些反馈可能是稀疏的、异步的和有噪声的。HuGE 不仅在仿真中而且在真实世界中引导强化学习的探索,且无需细致的奖励设定。其核心思想在于将人类反馈与策略学习分叉:人类反馈引导探索,而来自探索数据的自监督学习产生无偏策略。该过程可利用有噪声的、异步的人类反馈来学习策略,无需手工设计的奖励或探索奖励。HuGE 能够利用来自非专家用户的众包反馈,在仿真中学习各种具有挑战性的多阶段机器人导航与操作任务。此外,该范式可扩展到直接在真实世界机器人上学习,使用来自人类监督者的偶发、异步反馈。

关键词

引用

@article{arxiv.2307.11049,
  title  = {Breadcrumbs to the Goal: Goal-Conditioned Exploration from Human-in-the-Loop Feedback},
  author = {Marcel Torne and Max Balsells and Zihan Wang and Samedh Desai and Tao Chen and Pulkit Agrawal and Abhishek Gupta},
  journal= {arXiv preprint arXiv:2307.11049},
  year   = {2023}
}