中文

TREX:面向多目标强化学习的轨迹解释

机器学习 2026-03-24 v1 人工智能

摘要

强化学习(RL)已在诸多领域 demonstrate 其解决复杂决策问题的能力,通过与环境交互获取奖励信号。然而,许多真实场景涉及多个 potentially 相冲突的目标,难以用单一标量奖励表示。多目标强化学习(MORL)通过使代理能够同时优化多个目标,显式地推理目标之间的权衡,以解决这一限制。然而,RL 模型的 "黑箱" 性质使得背后所选目标权衡的决策过程不清晰。当前的可解释强化学习(XRL)方法通常为单一标量奖励设计,不考虑针对不同目标或用户偏好进行解释。为填补这一差距,本文提出 TREX,即基于轨迹的可解释性框架,用于解释多目标强化学习策略,基于轨迹归因。TREX 通过从学习到的专家策略中生成轨迹,跨越不同用户偏好并将其聚类为语义上有意义的时序片段。我们通过训练排除特定聚类的补充策略,衡量其相对于原始专家策略在所观察到的奖励和动作上的相对偏差,来量化这些行为片段对 Pareto 权衡的影响。在多目标 MuJoCo 环境中进行实验,包括 HalfCheetah、Ant 和 Swimmer,证明了该框架在隔离和量化特定行为模式方面的能力。

关键词

引用

@article{arxiv.2603.21988,
  title  = {TREX: Trajectory Explanations for Multi-Objective Reinforcement Learning},
  author = {Dilina Rajapakse and Juan C. Rosero and Ivana Dusparic},
  journal= {arXiv preprint arXiv:2603.21988},
  year   = {2026}
}

备注

Accepted by 4th World Conference on eXplainable Artificial Intelligence