中文

关于一类标准奖励函数的非平稳多臂老虎机问题中贪婪策略的最优性

机器学习 2011-04-29 v1 系统与控制 最优化与控制

摘要

本文考虑非平稳多臂老虎机问题,这是决策理论中著名的随机多臂老虎机问题最广泛研究的推广之一。然而,已知该问题在PSPACE意义下难以近似到任何非平凡因子。因此,由于其高复杂性,最优性很难获得。一种自然的方法是考虑贪婪策略,因为它稳定且简单。然而,贪婪策略通常会因其固有的短视行为而导致最优性损失。本文通过分析一类所谓的标准奖励函数,建立了关于折扣因子β\beta的闭式条件,使得在折扣期望奖励准则下贪婪策略的最优性得到保证,特别是条件β=1\beta=1表明在平均累积奖励准则下贪婪策略的最优性。因此,标准形式的奖励函数可以轻松用于判断贪婪策略的最优性,无需任何复杂计算。文中给出了认知无线电网络中的一些例子,以验证该数学结果在判断贪婪策略最优性方面的有效性。

关键词

引用

@article{arxiv.1104.5391,
  title  = {On Optimality of Greedy Policy for a Class of Standard Reward Function of Restless Multi-armed Bandit Problem},
  author = {Quan Liu and Kehao Wang and Lin Chen},
  journal= {arXiv preprint arXiv:1104.5391},
  year   = {2011}
}