中文

强化学习中跳帧的分析

机器学习 2021-02-09 v1

摘要

在序贯决策实践中,智能体常被设计为以 dd 个时间步(d>1d > 1)的固定间隔感知状态,忽略感知步之间的状态信息。虽然显然该做法可降低感知与计算成本,但近期结果表明其另有裨益。在许多Atari主机游戏中,当以 d>1d > 1 运行时——事实上 dd 甚至高达 180180——强化学习(RL)算法能给出明显更优的策略。本文研究参数 dd 在RL中的作用;dd 被称为“跳帧”参数,因为Atari域中的状态为图像。对于评估固定策略,我们观察到在标准条件下,跳帧不影响渐近一致性。视其他参数而定,它甚至可能有益于学习。要在控制设置中使用 d>1d > 1,必须首先指定在感知步之间可执行哪些 dd 步开环动作序列。我们聚焦于“动作重复”,即该选择被限制为相同动作的 dd 长序列这一常见约束。我们定义了一个称为“惯性代价”的任务相关量,并据此对动作重复所带来的损失给出上界。我们表明该损失可能被更短任务视界给学习带来的增益所抵消。我们的分析得到不同任务与学习算法上实验的支持。

关键词

引用

@article{arxiv.2102.03718,
  title  = {An Analysis of Frame-skipping in Reinforcement Learning},
  author = {Shivaram Kalyanakrishnan and Siddharth Aravindan and Vishwajeet Bagdawat and Varun Bhatt and Harshith Goka and Archit Gupta and Kalpesh Krishna and Vihari Piratla},
  journal= {arXiv preprint arXiv:2102.03718},
  year   = {2021}
}