不完美信息下的双臂 Restless Bandit:随机控制与可索引性
最优化与控制
2017-03-22 v2
摘要
我们提出了一个不确定性下决策的双臂 bandit 模型,其中投资“风险臂”的期望回报在选择该臂时增加,在选择“安全臂”时减少。这些动态在人力资本开发、求职和职业选择等应用中很自然。利用随机控制的新见解,以及收益动态的单调性条件,我们证明了我们模型中的最优策略是停止规则,可由一个指数刻画,该指数形式上与 Gittins 指数一致。我们的结果意味着一类新的 restless bandit 模型的可索引性。
引用
@article{arxiv.1506.07291,
title = {Two-Armed Restless Bandits with Imperfect Information: Stochastic Control and Indexability},
author = {Roland Fryer and Philipp Harms},
journal= {arXiv preprint arXiv:1506.07291},
year = {2017}
}
备注
49 pages