中文

错误取值但良好行为:高度误设定下的赌博机与 MDP 学习

机器学习 2024-02-23 v2 人工智能

摘要

基于参数化、特征的奖励模型被赌博机与马尔可夫决策过程(MDPs)等决策场景中的多种算法所采用。算法分析的典型假设是实现性,即动作的真实值可由类中某参数化模型完美解释。然而,我们关注真实值相对于模型类(显著)误设定的情形。对于参数化赌博机、上下文赌博机与 MDPs,我们识别出依赖于问题实例与模型类的结构条件,在此条件下即便高度误设定模型下,诸如 ϵ\epsilon-greedy、LinUCB 与拟合 Q 学习等基本算法也可证明地学习到最优策略。这与现有误设定赌博机的最坏情况结果形成对比,后者显示后悔界随时间长线性增长,并表明存在非平凡大类的赌博机实例对误设定具有鲁棒性。

关键词

引用

@article{arxiv.2310.09358,
  title  = {Bad Values but Good Behavior: Learning Highly Misspecified Bandits and MDPs},
  author = {Debangshu Banerjee and Aditya Gopalan},
  journal= {arXiv preprint arXiv:2310.09358},
  year   = {2024}
}