带约束臂的 restless _bandit:在社会与信息网络中的应用
系统与控制
2018-01-22 v2 最优化与控制
摘要
我们研究了一个社会网络中信息收集问题,其中信息源动态可用且信息质量随时间变化。我们将该问题建模为 restless 多臂 bandit(RMAB)。在此问题中,信息源的信息质量对应于 RMAB 中臂的状态。决策智能体事先并不知道各信息源的信息质量,但维持着对每个信息源信息质量的信念。这是一个具有部分可观测状态的 RMAB 问题。智能体的目标是通过联系信息源高效收集相关信息。我们将其表述为无限期折扣奖励问题,其中奖励取决于信息质量。我们研究了 Whittle 指标策略,该策略确定使长期累积奖励最大化的臂的播放序列。我们通过数值仿真说明了指标策略、短视策略的性能,并与均匀随机策略进行比较。
引用
@article{arxiv.1801.03634,
title = {Restless Bandits with Constrained Arms: Applications in Social and Information Networks},
author = {Varun Mehta and Rahul Meshram and Kesav Kaza and S. N. Merchant},
journal= {arXiv preprint arXiv:1801.03634},
year = {2018}
}