中文

利用权重信号——基于强化学习的可解释性预测与提升

机器学习 2025-11-26 v1 人工智能

摘要

强化学习(RL)代理的可解释性(即在与训练环境不同的环境中执行的能力)是关键问题,因为代理倾向于过度拟合其训练环境。为此,我们引入一种新方法,通过代理神经网络内部权重预测RL代理的可解释性得分。基于此预测能力,我们提出了对Proximal Policy Optimization(PPO)损失函数进行一些修改,以提升使用此升级版训练的代理的可解释性得分。实验结果表明,我们改进的PPO算法产生的代理在可解释性方面优于原始版本。

关键词

引用

@article{arxiv.2511.20234,
  title  = {Leveraging weights signals -- Predicting and improving generalizability in reinforcement learning},
  author = {Olivier Moulin and Vincent Francois-lavet and Paul Elbers and Mark Hoogendoorn},
  journal= {arXiv preprint arXiv:2511.20234},
  year   = {2025}
}