中文

DQN真的学会了吗?探索Pong中的对抗训练方案

机器学习 2022-03-22 v1

摘要

本工作中,我们研究了两种自对弈训练方案Chainer和Pool,并显示它们相比在标准DQN智能体(对内置Atari对手训练)下,在Atari Pong中带来了智能体性能的提升。为衡量智能体性能,我们定义了一种鲁棒性度量,捕捉学习一种击败智能体所学策略的策略的难度。通过游玩自身的过往版本,Chainer和Pool能够针对其策略中的弱点并提升抗攻击能力。采用这些方法训练的智能体在我们的鲁棒性度量上得分良好,并能轻松击败标准DQN智能体。最后我们使用线性探测来阐明不同智能体为玩游戏所发展的内部结构。我们显示,与标准DQN智能体相比,用Chainer或Pool训练智能体产生了更丰富的网络激活,对估计关键游戏状态特征具有更强的预测能力。

关键词

引用

@article{arxiv.2203.10614,
  title  = {Does DQN really learn? Exploring adversarial training schemes in Pong},
  author = {Bowen He and Sreehari Rammohan and Jessica Forde and Michael Littman},
  journal= {arXiv preprint arXiv:2203.10614},
  year   = {2022}
}

备注

RLDM 2022