BXRL: 行为可解释强化学习
机器学习
2026-03-26 v1
摘要
强化学习的一个主要挑战是智能体常会学习出违背其给定奖励结构的希望行为。可解释强化学习(XRL)方法可以回答诸如“解释这个具体动作”、“解释这个具体轨迹”和“解释整个策略”等查询。然而,XRL缺乏对行为的正式定义,即跨越多个回合动作模式。我们提供了这样一种定义,并用以支持一种新查询:“解释这个行为”。我们提出行为可解释强化学习(BXRL),一种新的问题表述,将行为视为一等对象。BXRL将行为度量定义为任意函数,允许用户精确表达他们感兴趣的动作模式,并衡量该策略是否 exhibits该模式。我们定义了对比行为,将问题“为何代理人偏好动作a而非动作a'”简化为“为何得分高”,这可以通过求导来探索。我们不实现一种可解释性方法;相反,我们分析了三种现有方法,并提出了如何适应以解释行为。我们 presented了对HighwayEnv驾驶环境的一个JAX移植版,提供了用于定义、衡量和相对于模型参数进行行为区分的接口。
引用
@article{arxiv.2603.23738,
title = {BXRL: Behavior-Explainable Reinforcement Learning},
author = {Ram Rachum and Yotam Amitai and Yonatan Nakar and Reuth Mirsky and Cameron Allen},
journal= {arXiv preprint arXiv:2603.23738},
year = {2026}
}