基于代理智能体 - 环境接口的深度强化学习
机器学习
2017-11-13 v3
摘要
本文在强化学习中提出了代理智能体 - 环境接口 (SAEI)。我们还指出,基于概率代理智能体 - 环境接口的学习能够提供任务智能体 - 环境接口的最优策略。我们引入了代理概率动作,并基于 SAEI 开发了概率代理动作确定性策略梯度 (PSADPG) 算法。该算法实现了对离散动作的连续控制。实验表明,PSADPG 在特定任务中达到了 DQN 的性能,并在初始训练阶段具有随机最优策略的特性。
引用
@article{arxiv.1709.03942,
title = {Deep Reinforcement Learning with Surrogate Agent-Environment Interface},
author = {Song Wang and Yu Jing},
journal= {arXiv preprint arXiv:1709.03942},
year = {2017}
}