中文

探索随机离散多臂赌博机时信息价值的分析

人工智能 2018-03-06 v2 机器学习 机器学习

摘要

在本文中,我们为随机、离散的多臂赌博机提出了一种基于信息论的探索策略,该策略可实现最优遗憾。我们的策略基于信息价值准则。该准则衡量了策略信息与可获得奖励之间的权衡。高策略信息量与以探索为主导的空间搜索相关,并产生高奖励。低策略信息量则有利于利用现有知识。在此准则中,信息由一个可在搜索过程中变化的参数来量化。我们证明,对该参数进行类似模拟退火的更新,并采用足够快的冷却计划,可导致相对于回合数呈对数形式的最优遗憾。

关键词

引用

@article{arxiv.1710.02869,
  title  = {An Analysis of the Value of Information when Exploring Stochastic, Discrete Multi-Armed Bandits},
  author = {Isaac J. Sledge and Jose C. Principe},
  journal= {arXiv preprint arXiv:1710.02869},
  year   = {2018}
}

备注

Entropy