中文

采用同一感知控制架构在无训练情况下于两款 Atari 拨板游戏上取得高性能

机器学习 2021-08-05 v1 人机交互

摘要

深度强化学习(DRL)需要大量样本和较长训练时间才能达到最优表现。然而人类在获得准确的指令程序后,很少需要长时间训练即可在诸如电脑游戏等新任务上表现良好。我们利用感知控制理论(PCT)构建了一个简单的闭环模型,该模型在使用 Arcade Learning Environment(ALE)的视频游戏研究中无需训练样本和训练时间。该模型被编程为将来自环境的输入解析为按层级组织的感知信号,并通过从参考信号中减去每个感知变量的输入信号来计算动态误差信号,以驱动输出信号减小该误差。我们在 Breakout 和 Pong 两款不同的 Atari 拨板游戏上测试了同一模型,取得了至少与 DRL 范式相当、且接近人类良好表现的性能。我们的研究表明,基于简单假设的感知控制模型无需学习即可表现良好。最后我们阐明了学习可能更为贴近心理功能的简约作用。

关键词

引用

@article{arxiv.2108.01895,
  title  = {High Performance Across Two Atari Paddle Games Using the Same Perceptual Control Architecture Without Training},
  author = {Tauseef Gulrez and Warren Mansell},
  journal= {arXiv preprint arXiv:2108.01895},
  year   = {2021}
}

备注

4 pages Letter