中文

面向延迟强化任务的 InferNet:解决时序信用分配问题

机器学习 2021-05-04 v1

摘要

时序信用分配问题(CAP)是人工智能中一个众所周知且具有挑战性的任务。虽然强化学习(RL),尤其是深度 RL,在可获得即时奖励时表现良好,但当仅有延迟奖励可用或奖励函数含噪声时可能失效。本文中,我们提出将 CAP 委托给一个名为 InferNet 的基于神经网络的算法,其显式学习从延迟奖励推断即时奖励。InferNet 的有效性在两个在线 RL 任务(简单 GridWorld 与 40 个 Atari 游戏)以及两个离线 RL 任务(GridWorld 与真实脓毒症治疗任务)上进行了评估。对所有任务,在使用与不使用噪声两种设置下,将使用 InferNet 推断奖励的效果与即时奖励及延迟奖励进行比较。总体而言,我们的结果表明 InferNet 对噪声奖励函数具有鲁棒性,并且是解决广泛 RL 任务(从经典 RL 仿真环境到真实世界 RL 问题,以及在线与离线学习)中时序 CAP 的有效附加机制。

关键词

引用

@article{arxiv.2105.00568,
  title  = {InferNet for Delayed Reinforcement Tasks: Addressing the Temporal Credit Assignment Problem},
  author = {Markel Sanz Ausin and Hamoon Azizsoltani and Song Ju and Yeo Jin Kim and Min Chi},
  journal= {arXiv preprint arXiv:2105.00568},
  year   = {2021}
}