中文

利用人类领域知识为强化学习问题建模经验奖励函数

信息论 2019-09-17 v1 math.IT

摘要

传统强化学习(RL)问题依赖于对问题真实物理进行建模的详尽仿真环境,并通过观测该环境训练 RL 智能体。本文提出一种新方法:基于从所研究系统的人类领域知识中提取的经验规则对奖励函数建模,从而创建环境。利用该经验奖励函数,我们将构建环境并训练智能体。我们首先创建一个模拟通过恒温器设定车厢温度影响的环境。RL 问题中通常通过对系统进行详尽的热力学研究建模来完成此任务。相反,我们提出一种基于人类领域知识对奖励函数建模的经验方法。我们将记录作为人类在设定恒温器温度时通常遵循的一些经验法则,并尝试将其建模到奖励函数中。这种将人类领域经验规则建模为 RL 奖励函数正是本文的独特之处。这是一个连续动作空间问题,我们将使用深度确定性策略梯度(DDPG)方法来求解以最大化奖励函数。我们将创建一个策略网络,在给定外部温度和湿度时预测最优温度设定点。

关键词

引用

@article{arxiv.1909.07117,
  title  = {Downlink Pilot Precoding and Compressed Channel Feedback for FDD-Based Cell-Free Systems},
  author = {Seungnyun Kim and Jun Won Choi and Byonghyo Shim},
  journal= {arXiv preprint arXiv:1909.07117},
  year   = {2019}
}

备注

Submitted to IEEE Transactions on Wireless Communications. Copyright 2019 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses