基于时序策略分解的可解释强化学习
机器学习
2025-01-08 v1 人工智能
摘要
我们从时序视角研究强化学习(RL)策略的可解释性,聚焦于单个动作关联的未来结果序列。 在 RL 中,价值函数压缩了跨多个轨迹和无限时间范围内奖励收集的信息,允许紧凑的知识表示形式。然而,这种压缩掩盖了序列决策中固有的时序细节,成为可解释性的关键挑战。我们提出时序策略分解(Temporal Policy Decomposition, TPD),这是一种新颖的可解释方法,通过预期未来结果(Expected Future Outcome, EFO)解释单个 RL 动作。这些解释将广义价值函数分解为序列中的 EFO,每个 EFO 对应一个时间步,直至感兴趣的预测时域,揭示特定结果预期发生的时间点。我们利用固定时域时序差分学习,构建一种用于学习 optimal 和次优动作 EFO 的 off-policy 方法,从而实现基于不同状态-动作对比的解释。我们的实验表明,TPD 生成的解释(1)阐明策略的未来策略和预期轨迹,以及(2)促进对奖励组成的理解,便于微调奖励函数以符合人类期望。
引用
@article{arxiv.2501.03902,
title = {Explainable Reinforcement Learning via Temporal Policy Decomposition},
author = {Franco Ruggeri and Alessio Russo and Rafia Inam and Karl Henrik Johansson},
journal= {arXiv preprint arXiv:2501.03902},
year = {2025}
}
备注
21 pages, 4 figures