中文

基于流形的原型分析用于可解释强化学习

机器学习 2026-04-01 v2

摘要

近年来,强化学习(RL)的应用范围不断扩大,从实时游戏到使用人类偏好数据微调大型语言模型显著提升了用户期望的对齐度。然而,随着模型复杂度的指数级增长,这些系统的可解释性变得越来越具有挑战性。虽然为计算机视觉和自然语言处理开发了众多可解释性方法来阐明局部和全局推理模式,但在 RL 领域的应用仍有限。直接将这些方法扩展往往难以在 RL 环境中维持可解释性与性能之间的精细平衡。最近显示出在 RL 领域提升可解释性而不牺牲原始黑箱模型效率的原型-包装网络(PW-Nets)前景广阔。然而,这些方法通常需要手动定义参考原型,这往往需要专业的领域知识。本文提出了一种方法,通过自动从可用数据中选择最优原型来消除这一依赖。标准 Gym 环境的初步实验表明,我们的方法在性能上与现有 PW-Nets 相当,并且与原始黑箱模型保持竞争力。

关键词

引用

@article{arxiv.2603.27971,
  title  = {Principal Prototype Analysis on Manifold for Interpretable Reinforcement Learning},
  author = {Bodla Krishna Vamshi and Haizhao Yang},
  journal= {arXiv preprint arXiv:2603.27971},
  year   = {2026}
}