通过多目标Bandit融合控制器
系统与控制
2020-08-03 v1 系统与控制
摘要
在序贯决策问题中,安全性与性能常是两个相互竞争的目标。现有高性能控制器(如由强化学习算法导出的控制器)往往缺乏安全性保证。相反,保证安全的控制器(如经典控制理论导出的控制器)需要限制性假设且性能常偏保守。我们的目标是将一个高性能与一个安全控制器相融合,生成单一控制器,其比高性能控制器更安全且比安全控制器累积更高奖励。为此,我们提出一种利用上下文多臂多目标bandit框架的融合算法。在每一阶段,算法观测环境当前上下文及即时奖励与代价(即底层安全度量),并基于观测决定采用哪一控制器。我们证明该算法实现次线性Pareto遗憾,这一性能指标刻画了与始终避免选择安全与性能均劣的控制器之专家的一致性。我们推导了各目标损失的界,其不引入额外计算复杂度。我们在以安全为核心的测试平台Safety Gym环境中实证展示了该算法成功融合安全与高性能控制器。对融合控制器总奖励与代价的统计分析反映两个关键结论:融合控制器相较安全控制器性能严格提升,且比高性能控制器更安全。
引用
@article{arxiv.2007.15755,
title = {Blending Controllers via Multi-Objective Bandits},
author = {Parham Gohari and Franck Djeumou and Abraham P. Vinod and Ufuk Topcu},
journal= {arXiv preprint arXiv:2007.15755},
year = {2020}
}
备注
Under review at NeurIPS 2020