面向保守离线策略评估的幻觉对抗控制
机器学习
2023-05-29 v2 人工智能
机器学习
摘要
我们研究保守离策略评估(COPE)问题:给定由其他智能体收集的环境交互离线数据集,我们试图获得策略性能的一个(紧)下界。这在决定给定策略在部署到真实世界之前是否满足某些最小性能/安全标准时至关重要。为此,我们提出HAMBO,其构建于具有不确定性感知的转移动力学学习模型之上。为形成策略性能的保守估计,HAMBO在模型认知置信区域边界内幻觉出策略可能采取的最坏情况轨迹。我们证明所得COPE估计是有效的下界,并在正则条件下展示其收敛至真实期望回报。最后,我们讨论基于贝叶斯神经网络(Bayesian Neural Networks)的可扩展变体,并经验性地证明它们在各种连续控制环境中产生可靠且紧的下界。
引用
@article{arxiv.2303.01076,
title = {Hallucinated Adversarial Control for Conservative Offline Policy Evaluation},
author = {Jonas Rothfuss and Bhavya Sukhija and Tobias Birchler and Parnian Kassraie and Andreas Krause},
journal= {arXiv preprint arXiv:2303.01076},
year = {2023}
}
备注
Conference on Uncertainty in Artificial Intelligence (UAI) 2023, first three authors contributed equally