中文

关于元强化学习与在线 LQR 中任务相关的损失函数

机器学习 2023-12-12 v1 系统与控制 系统与控制

摘要

设计在数据使用方面高效的元强化学习 算法,仍是其成功应用于现实世界所亟待解决的核心挑战。在本文中,我们提出了一种样本高效的元 RL 算法,该算法以任务导向的方式学习当前系统或环境的模型。与标准的基于模型的元 RL 方法不同,我们的方法利用价值信息以快速捕捉环境中对决策至关重要的部分。我们方法的关键组件是用于学习任务推断模块和系统模型的损失函数,该函数系统地将模型偏差与价值估计耦合,从而与现有的元 RL 算法相比,能够利用显著更少的数据促进策略和任务推断模块的学习。该思想也被扩展到非元 RL 设定,即在线线性二次调节器 (LQR) 问题中,在此我们的方法可以被简化以揭示该策略的本质。所提出的方法在高维机器人控制和在线 LQR 问题中进行了评估,从经验上验证了其在以样本高效的方式从观测中提取解决任务不可或缺的信息方面的有效性。

关键词

引用

@article{arxiv.2312.05465,
  title  = {On Task-Relevant Loss Functions in Meta-Reinforcement Learning and Online LQR},
  author = {Jaeuk Shin and Giho Kim and Howon Lee and Joonho Han and Insoon Yang},
  journal= {arXiv preprint arXiv:2312.05465},
  year   = {2023}
}