中文

面向保守离线策略评估的幻觉对抗控制

机器学习 2023-05-29 v2 人工智能 机器学习

摘要

我们研究保守离策略评估(COPE)问题:给定由其他智能体收集的环境交互离线数据集,我们试图获得策略性能的一个(紧)下界。这在决定给定策略在部署到真实世界之前是否满足某些最小性能/安全标准时至关重要。为此,我们提出HAMBO,其构建于具有不确定性感知的转移动力学学习模型之上。为形成策略性能的保守估计,HAMBO在模型认知置信区域边界内幻觉出策略可能采取的最坏情况轨迹。我们证明所得COPE估计是有效的下界,并在正则条件下展示其收敛至真实期望回报。最后,我们讨论基于贝叶斯神经网络(Bayesian Neural Networks)的可扩展变体,并经验性地证明它们在各种连续控制环境中产生可靠且紧的下界。

关键词

引用

@article{arxiv.2303.01076,
  title  = {Hallucinated Adversarial Control for Conservative Offline Policy Evaluation},
  author = {Jonas Rothfuss and Bhavya Sukhija and Tobias Birchler and Parnian Kassraie and Andreas Krause},
  journal= {arXiv preprint arXiv:2303.01076},
  year   = {2023}
}

备注

Conference on Uncertainty in Artificial Intelligence (UAI) 2023, first three authors contributed equally