中文

通过层次化探索-利用权衡实现上下文MDP的离线Oracle高效学习

机器学习 2024-05-29 v1 机器学习

摘要

受近期发现的从上下文bandits到离线回归的统计和计算简化(Simchi-Levi 和 Xu,2021)的启发,我们解决了一般(随机)上下文MDP(CMDP)问题,其时域为H(即称为具有H层的CMDP)。本文中,我们引入了从CMDP到离线密度估计的简化,前提是提供包含真实 underlying CMDP 的模型类M。我们开发了一个高效、统计上接近最优的算法,只需在所有T轮交互中调用O(HlogT)次离线密度估计算法(或Oracle)。如果提前知道T,该数字可进一步减少到O(HloglogT)。我们的结果标志着首次在不对模型类施加任何结构假设的情况下,从CMDP到离线密度估计实现高效且接近最优的简化。值得注意的是,我们算法的一个显著特点是设计针对CMDP层次结构的层次化探索-利用权衡。此外,我们的算法具有通用性,可用于奖励自由强化学习中的纯粹探索任务。

关键词

引用

@article{arxiv.2405.17796,
  title  = {Offline Oracle-Efficient Learning for Contextual MDPs via Layerwise Exploration-Exploitation Tradeoff},
  author = {Jian Qian and Haichen Hu and David Simchi-Levi},
  journal= {arXiv preprint arXiv:2405.17796},
  year   = {2024}
}