有限随机部分监测中的遗憾下界与最优算法
机器学习
2015-10-01 v1 机器学习
摘要
部分监测是一种具有有限反馈的序列学习的通用模型,被形式化为两个玩家之间的博弈。在此博弈中,学习器选择一个动作,同时对手选择一个结果,然后学习器遭受损失并接收一个反馈信号。学习器的目标是最小化总损失。在本文中,我们研究具有有限动作和随机结果的部分监测。我们推导出一个对数的、依赖于分布的遗憾下界,它定义了问题的难度。受用于多臂老虎机问题的 DMED algorithm (Honda and Takemura, 2010) 启发,我们提出 PM-DMED,一种最小化依赖于分布的遗憾的算法。PM-DMED 在数值实验中显著优于最先进算法。为展示 PM-DMED 相对于遗憾界的最优性,我们通过引入一个铰链函数 (PM-DMED-Hinge) 对该算法稍作修改。然后,我们推导出 PM-DMED-Hinge 的渐近最优遗憾上界,其与下界匹配。
引用
@article{arxiv.1509.09011,
title = {Regret Lower Bound and Optimal Algorithm in Finite Stochastic Partial Monitoring},
author = {Junpei Komiyama and Junya Honda and Hiroshi Nakagawa},
journal= {arXiv preprint arXiv:1509.09011},
year = {2015}
}
备注
24 pages, to appear in NIPS2015