观测时间序列及相关 restless bandit 问题的最优策略
机器学习
2017-03-30 v1
摘要
在数据获取与处理成本,以及由于缺乏数据导致的不确定性之间的权衡是机器学习中的基本问题。这种权衡的一个基本实例是决定是否对离散时间高斯随机游走进行有噪声且昂贵的观测,以最小化后验方差与观测成本之和的问题。我们首次证明了一种简单策略的最优性,该策略在后验方差超过阈值时进行观测,对此问题是最优的。该证明推广到除后验方差外的广泛成本函数。这一结果意味着,具有昂贵观测的线性二次高斯控制的最优策略具有阈值结构。它还意味着观测多个此类时间序列的 restless bandit 问题具有明确定义的 Whittle index。我们讨论了该指数的计算,给出了其闭式公式,并将相关指数策略的性能与启发式策略进行了比较。该证明基于一个新的验证定理,该定理展示了马尔可夫决策过程的阈值结构,以及被称为机械词(mechanical words)的二元序列与不连续非线性映射动力学之间的关系,后者经常出现在物理、控制和生物学中。
引用
@article{arxiv.1703.10010,
title = {Optimal Policies for Observing Time Series and Related Restless Bandit Problems},
author = {Christopher R. Dance and Tomi Silander},
journal= {arXiv preprint arXiv:1703.10010},
year = {2017}
}
备注
In submission to JMLR. Authors' website: http://www.xrce.xerox.com