中文

面向数据高效强化学习的同时信用分配

机器学习 2022-05-25 v1 人工智能 系统与控制 系统与控制

摘要

广泛采样状态与动作空间的能力是构建有效强化学习算法的关键要素。本文所揭示的变分优化原理强调了占据模型的重要性,该模型综合了智能体可作用的环境状态的一般分布(定义一个虚拟“领地”)。占据模型随着探索推进及训练过程中新状态被揭示而频繁更新。在均匀先验假设下,所得目标表达了两种并发趋势之间的平衡,即占据空间的拓宽与奖励的最大化,令人联想到经典的探索/利用权衡。在经典连续动作基准上基于离策略 actor-critic 实现,结果表明其显著提升了采样效能,体现在密集与稀疏奖励情形下训练时间缩短且回报更高。

关键词

引用

@article{arxiv.2205.12020,
  title  = {Concurrent Credit Assignment for Data-efficient Reinforcement Learning},
  author = {Emmanuel Daucé},
  journal= {arXiv preprint arXiv:2205.12020},
  year   = {2022}
}

备注

IJCNN 2022 conference