SENTINEL:用基于集成的分布强化学习驯服不确定性
机器学习
2022-06-30 v3
摘要
在本文中,我们考虑强化学习(RL)中的风险敏感序贯决策。我们的贡献有两点。首先,我们引入一种新颖且连贯的风险量化方法,即复合风险,其量化了学习过程中偶然不确定性与认知不确定性的联合效应。现有工作要么单独考虑偶然或认知风险,要么将其作为加性组合。我们证明,当认知风险度量被期望替代时,加性公式是复合风险的一种特例。因此,复合风险比单独与加性公式对偶然和认知不确定性都更敏感。我们还提出一种算法 SENTINEL-K,基于集成自助采样与分布 RL 分别表征认知与偶然不确定性。K 个学习器的集成使用 Follow The Regularised Leader(FTRL)来聚合回报分布并获得复合风险。我们通过实验验证,SENTINEL-K 能更好地估计回报分布,且在采用复合风险估计时,表现出优于最先进的风险敏感与分布 RL 算法的风险敏感性能。
引用
@article{arxiv.2102.11075,
title = {SENTINEL: Taming Uncertainty with Ensemble-based Distributional Reinforcement Learning},
author = {Hannes Eriksson and Debabrota Basu and Mina Alibeigi and Christos Dimitrakakis},
journal= {arXiv preprint arXiv:2102.11075},
year = {2022}
}
备注
22 pages, 10 figures, 8 tables Accepted for UAI2022