中文

理解与控制迷宫求解策略网络

人工智能 2023-10-13 v1

摘要

为理解AI系统的目标及其目标表征,我们仔细研究了一个预训练的强化学习策略网络,该网络通过导航至一系列目标方格来求解迷宫。我们发现该网络追求多个上下文相关目标,并进一步识别出网络中与其中之一对应的回路。具体而言,我们识别出追踪目标位置的十一个通道。通过手工干预或组合前向传播修改这些通道,我们可以部分控制该策略。我们表明该网络包含冗余、分布式且可重定目标的目标表征,从而揭示训练策略网络中目标导向的本质。

关键词

引用

@article{arxiv.2310.08043,
  title  = {Understanding and Controlling a Maze-Solving Policy Network},
  author = {Ulisse Mini and Peli Grietzer and Mrinank Sharma and Austin Meek and Monte MacDiarmid and Alexander Matt Turner},
  journal= {arXiv preprint arXiv:2310.08043},
  year   = {2023}
}

备注

46 pages