基于残差过拟合的探索方法
机器学习
2021-10-07 v1 机器学习
摘要
探索是 bandit 与强化学习算法的关键方面。探索所必需的不确定性量化通常来自基于简单模型的闭式表达,或计算密集的重采样与后验近似。我们转而提出一种近似探索方法,仅拟合两个点位估计,一个经调优、一个过拟合。该方法被我们称为基于残差过拟合的探索方法(ROME),其将探索导向过拟合模型相较调优模型表现出最多过拟合的动作。直观理解在于,过拟合最频繁地发生在数据不足以形成准确奖励预测的动作与上下文处。我们从频率学派与贝叶斯信息论两个视角对该直觉进行了形式化论证。最终得到的方法可泛化至多种模型,并避免了重采样或后验近似的计算开销。我们在三个数据集上将 ROME 与一组成熟的上下文 bandit 方法比较,发现其性能位居前列。
关键词
引用
@article{arxiv.2110.02919,
title = {Residual Overfit Method of Exploration},
author = {James McInerney and Nathan Kallus},
journal= {arXiv preprint arXiv:2110.02919},
year = {2021}
}
备注
13 pages, 16 figures