批量策略优化中的模型选择
机器学习
2021-12-24 v1 机器学习
摘要
我们研究批量策略优化中的模型选择问题:给定固定的部分反馈数据集与 个模型类,学习一个与由最优模型类导出的策略相竞争的策略。我们在具有线性模型类的上下文_bandit(contextual bandit)设定下形式化该问题,识别出任何模型选择算法为保持竞争力所应最优权衡的三种误差来源:(1)近似误差,(2)统计复杂度,与(3)覆盖度。前两种来源在监督学习的模型选择中常见,其最优权衡已有充分研究。相反,第三种来源是批量策略优化特有的,源于该设定固有的数据集偏移。我们首先证明任何批量策略优化算法都无法同时给出涵盖全部三种误差的保证,揭示了批量策略优化的困难与监督学习中可得正面结果之间的鲜明对比。尽管有此负面结果,我们表明放宽三种误差来源中的任意一种,即可设计对剩余两种实现近 oracle 不等式的算法。我们以展示这些算法有效性的实验作结。
引用
@article{arxiv.2112.12320,
title = {Model Selection in Batch Policy Optimization},
author = {Jonathan N. Lee and George Tucker and Ofir Nachum and Bo Dai},
journal= {arXiv preprint arXiv:2112.12320},
year = {2021}
}