中文

基于决策-估计系数的交互式决策制定的紧致保证

机器学习 2023-01-20 v1 最优化与控制 统计理论 机器学习 统计理论

摘要

强化学习和交互式决策制定的一个基础问题是理解哪些建模假设会带来样本高效的学习保证,以及哪些算法设计原则能达到最优样本复杂度。最近,Foster 等人(2021)引入了决策-估计系数(DEC),这是一种统计复杂度的度量,可对涵盖带函数逼近的赌博机和强化学习的一般问题类给出最优样本复杂度的上界与下界。在本文中,我们引入 DEC 的一个新变体——约束决策-估计系数,并用它导出改进先前工作的三个方面的新下界:- 它们在期望意义下成立,对所考虑的算法类无任何限制。- 它们是全局成立的,不依赖于 Foster 等人(2021)所使用的局部化概念。- 最有趣的是,它们允许定义 DEC 所参照的模型是不恰当的(improper),从而确立不恰当参照模型发挥着基础性作用。我们给出了随同一量度缩放的悔值上界,从而填补了 Foster 等人(2021)中上界与下界之间除一个以外的所有鸿沟。我们的结果适用于悔值框架和 PAC 框架,并使用了几种我们预计会有更广泛应用的新分析和算法设计技术。

关键词

引用

@article{arxiv.2301.08215,
  title  = {Tight Guarantees for Interactive Decision Making with the Decision-Estimation Coefficient},
  author = {Dylan J. Foster and Noah Golowich and Yanjun Han},
  journal= {arXiv preprint arXiv:2301.08215},
  year   = {2023}
}