削减损失:在对抗性风险下学习容错控制与最优停止
系统与控制
2019-10-09 v3
摘要
近来,强化学习(RL)中对安全与鲁棒技术的兴趣激增。当前 RL 中的风险概念未能捕捉系统性故障的可能性,例如系统故障导致的突然停止或超出安全阈值,以及在此类情形下的适当响应控制。我们提出了一种 RL 中风险最小化的新方法:除采取最大化期望回报的动作外,控制器还学习一种对由突发事件(如突然故障)引起的停止具有鲁棒性的策略。本文结果涵盖了未知环境下随机停止与最优停止下最坏情形中的容错控制。通过证明该类问题可由随机对策的一种变体表示,我们证明了存在唯一不动点均衡的解,并刻画了最优控制器行为。随后我们引入一种值函数近似算法,该算法通过在未知环境中仿真收敛到该解。
引用
@article{arxiv.1902.05045,
title = {Cutting Your Losses: Learning Fault-Tolerant Control and Optimal Stopping under Adverse Risk},
author = {David Mguni},
journal= {arXiv preprint arXiv:1902.05045},
year = {2019}
}