中文

使用卷积神经网络的奖励塑形

人工智能 2022-11-01 v1 机器学习

摘要

本文提出用于奖励塑形的价值迭代网络(VIN-RS),一种基于势的、使用卷积神经网络(CNN)的奖励塑形机制。所提 VIN-RS 嵌入一个 CNN,该 CNN 使用隐马尔可夫模型的消息传递机制在计算得到标签上训练。CNN 处理环境图像或图以预测塑形值。近期奖励塑形工作仍限于在马尔可夫决策过程(MDP)的表示上训练并构建转移矩阵的估计。VIN-RS 的优势在于从估计的 MDP 构建有效的势函数,同时自动推断环境转移矩阵。所提 VIN-RS 通过自学习的卷积滤波器估计转移矩阵,同时从输入帧或采样图中提取环境细节。由于(1)先前使用消息传递进行奖励塑形的成功,以及(2) CNN 的规划行为,我们利用这些消息训练 VIN-RS 的 CNN。实验在表格游戏、Atari 2600 和 MuJoCo 上进行,涵盖离散与连续动作空间。我们的结果表明,与 SOTA 相比,学习速度和最大累积奖励均有可喜提升。

关键词

引用

@article{arxiv.2210.16956,
  title  = {Reward Shaping Using Convolutional Neural Network},
  author = {Hani Sami and Hadi Otrok and Jamal Bentahar and Azzam Mourad and Ernesto Damiani},
  journal= {arXiv preprint arXiv:2210.16956},
  year   = {2022}
}