面向可解释强化学习的代理适配度指标
机器学习
2025-04-22 v1 人工智能
摘要
我们采用演化优化框架,通过扰动初始状态生成信息丰富且多样的政策演示。联合代理适配度函数通过结合局部多样性、行为确定性和全局种群多样性来指导优化。为评估演示质量,我们应用一组评估指标,包括基于奖励的 optimality gap、fidelity 四分位均值(IQMs)、适配度组成分析以及轨迹可视化。还检查了超参数敏感性,以更好地理解轨迹优化的动力学。我们的发现表明,通过代理适配度指标优化轨迹选择显著提高了离散和连续环境中 RL 政策的可解释性。在网格世界领域,评估显示与随机和消融基线相比,演示保真度显著提升。在连续控制中,本框架为早期政策提供了有价值的见解,同时,基于保真度的优化对成熟政策更有效。通过细化和系统分析代理适配度函数,本研究推进了 RL 模型的可解释性。所提出的改进为深入理解 RL 决策提供了更深入的见解,惠及于安全关键和可解释性导向领域的应用。
引用
@article{arxiv.2504.14645,
title = {Surrogate Fitness Metrics for Interpretable Reinforcement Learning},
author = {Philipp Altmann and Céline Davignon and Maximilian Zorn and Fabian Ritz and Claudia Linnhoff-Popien and Thomas Gabor},
journal= {arXiv preprint arXiv:2504.14645},
year = {2025}
}
备注
30 pages, 7 figures, under review