不完美监控下的预测策略
统计理论
2008-01-07 v4 机器学习
统计理论
摘要
我们针对不完美监控下的序贯预测(即预测者无法获取过去结果而只能获得反馈信号)提出简单的随机化策略。所提策略是一致性的,即在渐近意义下达到可能的最佳平均奖励。Rustichini (1999) 首次证明了此类一致性预测器的存在性。此处给出的预测者提供了一致性的首个构造性证明。此外,所提算法计算高效。我们还建立了收敛速度的上界。在确定性反馈情形下,这些速度除对数项外是最优的。
引用
@article{arxiv.math/0701419,
title = {Strategies for prediction under imperfect monitoring},
author = {Gabor Lugosi and Shie Mannor and Gilles Stoltz},
journal= {arXiv preprint arXiv:math/0701419},
year = {2008}
}
备注
Journal version of a COLT conference paper