中文

有限随机部分监测中的遗憾下界与最优算法

机器学习 2015-10-01 v1 机器学习

摘要

部分监测是一种具有有限反馈的序列学习的通用模型,被形式化为两个玩家之间的博弈。在此博弈中,学习器选择一个动作,同时对手选择一个结果,然后学习器遭受损失并接收一个反馈信号。学习器的目标是最小化总损失。在本文中,我们研究具有有限动作和随机结果的部分监测。我们推导出一个对数的、依赖于分布的遗憾下界,它定义了问题的难度。受用于多臂老虎机问题的 DMED algorithm (Honda and Takemura, 2010) 启发,我们提出 PM-DMED,一种最小化依赖于分布的遗憾的算法。PM-DMED 在数值实验中显著优于最先进算法。为展示 PM-DMED 相对于遗憾界的最优性,我们通过引入一个铰链函数 (PM-DMED-Hinge) 对该算法稍作修改。然后,我们推导出 PM-DMED-Hinge 的渐近最优遗憾上界,其与下界匹配。

关键词

引用

@article{arxiv.1509.09011,
  title  = {Regret Lower Bound and Optimal Algorithm in Finite Stochastic Partial Monitoring},
  author = {Junpei Komiyama and Junya Honda and Hiroshi Nakagawa},
  journal= {arXiv preprint arXiv:1509.09011},
  year   = {2015}
}

备注

24 pages, to appear in NIPS2015