强化学习智能体的机制可解释性
机器学习
2024-11-05 v1
摘要
本文通过分析在程序化迷宫环境中训练的神经网络,探索强化学习(RL)智能体的机制可解释性。通过剖析网络的内部运作,我们识别出迷宫墙壁和通道等基本特征,这些特征构成了模型决策过程的基础。一个重要观察是目标误泛化,即RL智能体对某些导航策略产生偏好,例如始终朝向右上角移动,即使没有明确目标。使用显著性映射和特征映射等技术,我们可视化了这些偏好。我们进一步开发了用于交互式探索层激活的新工具,深化了这一探索。
引用
@article{arxiv.2411.00867,
title = {Mechanistic Interpretability of Reinforcement Learning Agents},
author = {Tristan Trim and Triston Grayston},
journal= {arXiv preprint arXiv:2411.00867},
year = {2024}
}