Wasserstein 自编码 MDP:具有多方保证的高效蒸馏强化学习策略的形式化验证
机器学习
2023-04-24 v2 人工智能
摘要
尽管深度强化学习(DRL)有许多成功案例,但这些先进技术学习的策略在安全关键场景中的大规模部署因其缺乏形式化保证而受阻。变分马尔可夫决策过程(VAE-MDP)是一种离散潜空间模型,为从任意 RL 策略蒸馏出可形式化验证的控制器提供了可靠框架。虽然相关保证涉及性能与安全性性质满足等实际相关方面,但 VAE 方法存在若干学习缺陷(后验坍缩、学习速度慢、动力学估计差),主要源于缺乏支撑潜优化的抽象与表示保证。我们引入了 Wasserstein 自编码 MDP(WAE-MDP),一种通过对执行原策略与蒸馏策略的智能体行为之间的最优传输的罚形式最小化来修复这些问题的潜空间模型,且形式化保证适用于蒸馏策略。我们的方法在学习蒸馏策略的同时给出互模拟保证,允许对抽象与表示模型质量进行具体优化。实验表明,除了将策略蒸馏速度提升至最多 10 倍外,潜模型质量总体上确实更优。此外,我们给出了潜空间上简单失效时间验证算法的实验。我们的方法能够支持此类简单验证技术,凸显了其适用性。
引用
@article{arxiv.2303.12558,
title = {Wasserstein Auto-encoded MDPs: Formal Verification of Efficiently Distilled RL Policies with Many-sided Guarantees},
author = {Florent Delgrange and Ann Nowé and Guillermo A. Pérez},
journal= {arXiv preprint arXiv:2303.12558},
year = {2023}
}
备注
ICLR 2023, 10 pages main text, 14 pages appendix (excluding references)