中文

诱导出、检测与刻画神经模块:强化学习功能可解释性管线

机器学习 2025-06-03 v2 人工智能

摘要

可解释性对于确保 RL 系统与人类价值观一致至关重要,但在复杂决策领域仍然具有挑战性。现有方法常尝试在基本模型单元(如神经元或决策节点)层面实现可解释性,这种方法在大型模型中扩展性差。本文提出了一种在功能模块层面实现可解释性的方法。我们展示,通过在网络权重中引入稀疏性和局部性,能够在 RL 策略网络中促使功能模块的出现。为了检测这些模块,我们发展了扩展的 Louvain 算法,采用新颖的“相关对齐”指标来克服标准网络分析技术在神经网络架构中应用的局限性。将这些方法应用于 2D 和 3D MiniGrid 环境,揭示了不同轴向导航模块一致出现的特征,并进一步演示了这些功能可以通过对网络权重在推理前进行直接干预来进行验证。

关键词

引用

@article{arxiv.2501.17077,
  title  = {Inducing, Detecting and Characterising Neural Modules: A Pipeline for Functional Interpretability in Reinforcement Learning},
  author = {Anna Soligo and Pietro Ferraro and David Boyle},
  journal= {arXiv preprint arXiv:2501.17077},
  year   = {2025}
}