中文

面向离线强化学习的多源数据行为估计

机器学习 2023-05-29 v3 机器人学

摘要

离线强化学习(RL)因其引人注目的数据效率而受到日益增长的关注。本研究探讨行为估计,这是许多离线 RL 算法的基础任务。行为估计旨在估计生成训练数据所采用的策略。特别地,本工作考虑数据从多个来源收集的场景。在此情况下,忽视数据异质性,现有的行为估计方法会遭受行为误指定。为克服这一缺陷,本研究提出一种潜变量模型,从数据中推断一组策略,使智能体能够将最能描述特定轨迹的策略用作行为策略。该模型为多源数据提供了细粒度的智能体刻画,并帮助其克服行为误指定。本工作还提出了该模型的学习算法,并通过扩展一种现有离线 RL 算法来展示其实用性。最后,通过广泛评估,本工作确认了行为误指定的存在以及所提模型的有效性。

关键词

引用

@article{arxiv.2211.16078,
  title  = {Behavior Estimation from Multi-Source Data for Offline Reinforcement Learning},
  author = {Guoxi Zhang and Hisashi Kashima},
  journal= {arXiv preprint arXiv:2211.16078},
  year   = {2023}
}

备注

Accepted by AAAI 2023. Fixed errors in Fig. 4, Table 1, and Eq (6) in the camera-ready version