中文

信息的马尔可夫代价

数据结构与算法 2019-02-22 v1

摘要

假设有 n 个马尔可夫链,且我们需要为推进它们而支付每步价格。马尔可夫链的“目标”状态包含奖励;然而,我们只能获得满足组合约束的其中子集的奖励,例如至多 k 个,或它们在底层图中无环。若我们的目标是最大化总奖励减去总支付价格,应选择什么策略来推进马尔可夫链?本文引入马尔可夫信息代价模型以刻画上述这类情形,其中组合优化问题的输入参数由马尔可夫链给出。我们设计了最优/近似算法,联合优化组合问题的值与总支付价格。我们还研究了算法对分布参数的鲁棒性以及如何处理承诺约束。我们的工作汇集了两条经典研究线索:马尔可夫多臂老虎机的最优策略,以及利用组合与线性规划松弛思想求解离散优化问题的精确与近似算法。

关键词

引用

@article{arxiv.1902.07856,
  title  = {The Markovian Price of Information},
  author = {Anupam Gupta and Haotian Jiang and Ziv Scully and Sahil Singla},
  journal= {arXiv preprint arXiv:1902.07856},
  year   = {2019}
}