中文

VRAIL:基于向量奖励的可解释学习

机器学习 2025-09-26 v4 人工智能

摘要

我们提出 VRAIL(Vectorized Reward-based Attribution for Interpretable Learning),一个用于价值型强化学习(RL)的双层框架,通过从状态特征中学习可解释的权重表征。VRAIL 包括两个阶段:一个深度学习(DL)阶段拟合估计值函数使用状态特征,以及一个 RL 阶段通过潜在奖励转换来塑造学习。该估计器可建模为线性或二次形式,允许对单个特征及其相互作用的重要性进行归因。对 Taxi-v3 环境的实证结果表明,VRAIL 在训练稳定性和收敛性方面优于标准 DQN,而无需环境修改。进一步分析显示,VRAIL 揭示了语义上有意义的子目标,如乘客持有情况,凸显了其产生人类可解释行为的能力。我们的发现表明,VRAIL 作为一种通用、模型无关的奖励塑形框架,既提升了学习效果,又增强了可解释性。

关键词

引用

@article{arxiv.2506.16014,
  title  = {VRAIL: Vectorized Reward-based Attribution for Interpretable Learning},
  author = {Jina Kim and Youjin Jang and Jeongjin Han},
  journal= {arXiv preprint arXiv:2506.16014},
  year   = {2025}
}