中文

模型不确定性下的鲁棒自适应规划

人工智能 2019-01-10 v1 机器学习

摘要

模型不确定性下的规划是决策与学习诸多应用中的基本问题。本文提出鲁棒自适应蒙特卡洛规划(RAMCP)算法,可计算风险敏感的贝叶斯自适应策略,最优地权衡探索、利用与鲁棒性。RAMCP将风险敏感规划问题表述为二人零和博弈,其中对手扰动智能体对模型的信念。我们引入两个版本的RAMCP算法。第一个RAMCP-F在模型底层信念受扰动时无需重建搜索树即可收敛到最优风险敏感策略。第二个版本RAMCP-I以丧失理论保证为代价提升计算效率,但被证明能产生与RAMCP-F相媲美的经验结果。RAMCP在n臂多臂老虎机问题及患者治疗场景中进行了演示。

关键词

引用

@article{arxiv.1901.02577,
  title  = {Robust and Adaptive Planning under Model Uncertainty},
  author = {Apoorva Sharma and James Harrison and Matthew Tsao and Marco Pavone},
  journal= {arXiv preprint arXiv:1901.02577},
  year   = {2019}
}