一个风险统领一切:基于模型的离线强化学习之风险敏感视角
机器学习
2023-10-31 v3
摘要
离线强化学习(RL)适用于在线探索成本过高或过于危险的安全关键领域。在这种安全关键场景中,决策应考虑灾难性结果的风险。换言之,决策应具有风险敏感性。先前关于离线 RL 中风险的工作将离线 RL 技术(以避免分布偏移)与风险敏感 RL 算法(以实现风险敏感性)结合在一起。在这项工作中,我们提出将风险敏感性作为一种共同解决这两个问题的机制。我们基于模型的方法对认知不确定性和偶然性不确定性均具有风险规避性。对认知不确定性的风险规避可防止分布偏移,因为数据集未覆盖的区域具有高认知不确定性。对偶然性不确定性的风险规避会抑制由于环境随机性而可能导致不良结果的行为。我们的实验表明,我们的算法在确定性基准上取得了有竞争力的性能,并在随机域中的风险敏感目标上优于现有方法。
引用
@article{arxiv.2212.00124,
title = {One Risk to Rule Them All: A Risk-Sensitive Perspective on Model-Based Offline Reinforcement Learning},
author = {Marc Rigter and Bruno Lacerda and Nick Hawes},
journal= {arXiv preprint arXiv:2212.00124},
year = {2023}
}
备注
NeurIPS 2023