具有形式可解释性的概率约束强化学习
机器学习
2024-06-18 v4 人工智能
机器人学
系统与控制
系统与控制
摘要
强化学习可为具有可变动力学的序贯决策问题提供有效推理。然而,此类推理在实际实现中,对奖励函数及相应最优策略的解释始终是一项持久挑战。因此,将序贯决策问题表述为概率推断具有相当价值,因为原则上该推断可提供多样且强大的数学工具来推断随机动力学,同时给出策略优化的概率解释。本研究中,我们提出一种新颖的自适应 Wasserstein 变分优化(AWaVO)以应对这些可解释性挑战。我们的方法利用形式化方法实现收敛保证、训练透明与内在决策解释的可解释性。为展示其实用性,我们在仿真与实际四旋翼任务中展示了具备最优全局收敛速率的保证可解释性。与包括 TRPO-IPO、PCPO 和 CRPO 在内的前沿基准相比,我们经实验验证 AWaVO 在高性能与充分可解释性之间提供了合理权衡。
引用
@article{arxiv.2307.07084,
title = {Probabilistic Constrained Reinforcement Learning with Formal Interpretability},
author = {Yanran Wang and Qiuchen Qian and David Boyle},
journal= {arXiv preprint arXiv:2307.07084},
year = {2024}
}
备注
25 pages, 9 figures, containing Appendix