中文

时间感知Q网络:解决深度强化学习中的时间不规则性

机器学习 2021-05-07 v1

摘要

深度强化学习(Deep Reinforcement Learning, DRL)在诱导有效动作策略以最大化许多复杂任务上的期望长期回报方面表现出色。大量DRL工作聚焦于具有离散时间步的事件序列,并忽略了连续事件间不规则的时间间隔。鉴于在许多真实领域,数据常由具有不规则时间间隔的时间序列组成,考虑时间事件间的时间间隔以捕捉状态的潜在渐进模式十分重要。本文提出一个通用的时间感知强化学习框架:时间感知Q网络(Time-aware Q-Networks, TQN),其在深度RL框架内考虑物理时间间隔。TQN从两方面处理时间不规则性:1)用于时间感知状态近似的过去经过时间与期望的下一观测时间;2)用于未来奖励时间感知折扣的动作时间窗口。实验结果表明,通过从两方面捕捉具有时间不规则性的序列中的底层结构,TQN在四类具有不规则时间间隔的情境下显著优于DQN。更具体地,我们的结果显示,在CartPole、MountainCar等经典RL任务以及具有随机分段时间间隔的Atari基准中,仅时间感知折扣更为重要;而在具有内在时间间隔的核反应堆操作和脓毒症患者治疗等真实任务中,时间感知状态与时间感知折扣均至关重要。此外,为提升智能体学习能力,我们探索了三种提升方法:Double networks、Dueling networks和Prioritized Experience Replay,结果显示对于两个真实任务,将三种提升方法均与TQN结合尤其有效。

关键词

引用

@article{arxiv.2105.02580,
  title  = {Time-Aware Q-Networks: Resolving Temporal Irregularity for Deep Reinforcement Learning},
  author = {Yeo Jin Kim and Min Chi},
  journal= {arXiv preprint arXiv:2105.02580},
  year   = {2021}
}

备注

36 pages, 27 figures