中文

面向强化学习的带分层前向模型的多时域表征

机器学习 2024-01-30 v2

摘要

从像素学习控制对强化学习(RL)智能体而言是困难的,因为表征学习与策略学习相互交织。先前方法借助辅助表征学习任务缓解该问题,但它们要么未考虑问题的时间维度,要么仅考虑单步转移,若重要环境变化需多步才显现,则可能导致学习效率低下。我们提出分层 kk 步隐空间(HKSL),一种通过分层前向模型(学习通信)与一组均以不同跳步幅度运行的 nn 步评论家集成来学习多种表征的辅助任务。我们在 30 项含与不含干扰项的机器人控制任务集及一项我们自建任务上评估 HKSL。我们发现 HKSL 比若干替代表征学习方法更快收敛到更高或最优回合回报。此外,我们发现 HKSL 的表征能跨时间尺度准确捕捉任务相关细节(即便存在干扰项),且分层层级间的通信信道基于通信双方组织信息,二者均提升了样本效率。

关键词

引用

@article{arxiv.2206.11396,
  title  = {Multi-Horizon Representations with Hierarchical Forward Models for Reinforcement Learning},
  author = {Trevor McInroe and Lukas Schäfer and Stefano V. Albrecht},
  journal= {arXiv preprint arXiv:2206.11396},
  year   = {2024}
}

备注

Published in TMLR