中文

深层强化学习代理环境复杂度在表征学习中的作用

机器学习 2025-03-20 v2

摘要

我们开发了一个模拟环境,用于训练深层强化学习代理,在受动力学范式中用于人类导航员的测试中所使用的捷径使用导航任务上进行训练。我们人为操控了代理暴露于捷径和导航线索的频率,以探讨这些因素如何影响捷径使用开发。我们发现,所有代理在初始学习开始后迅速在封闭捷径试验中实现最佳性能。然而,他们在捷径敞开时发生速度和捷径使用的代理速度更快。分析代理人工神经网络活动显示,频繁呈现线索最初导致单个节点中对线索的更好编码,与遇到线索较少的代理相比。然而,更强的线索表征最终是通过在导航规划中使用线索来形成的,而不仅仅是通过暴露。我们发现,在所有代理中,空间表征在训练初期发展,然后在导航策略完全发展之前稳定,这表明具有空间一致的激活是基本导航所必需的,但不足以发展出高级策略。此外,使用新的分析技术,我们发现计划的轨迹而非代理的当前位置被编码在代理的网络中。而且,这种编码是在群体层面而非单个节点的层面表示的。这些技术可以更广泛地应用于研究单个活动模式之外的神经元或网络节点群体的神经活动。

关键词

引用

@article{arxiv.2407.03436,
  title  = {A Role of Environmental Complexity on Representation Learning in Deep Reinforcement Learning Agents},
  author = {Andrew Liu and Alla Borisyuk},
  journal= {arXiv preprint arXiv:2407.03436},
  year   = {2025}
}