探索随机离散多臂赌博机时信息价值的分析
人工智能
2018-03-06 v2 机器学习
机器学习
摘要
在本文中,我们为随机、离散的多臂赌博机提出了一种基于信息论的探索策略,该策略可实现最优遗憾。我们的策略基于信息价值准则。该准则衡量了策略信息与可获得奖励之间的权衡。高策略信息量与以探索为主导的空间搜索相关,并产生高奖励。低策略信息量则有利于利用现有知识。在此准则中,信息由一个可在搜索过程中变化的参数来量化。我们证明,对该参数进行类似模拟退火的更新,并采用足够快的冷却计划,可导致相对于回合数呈对数形式的最优遗憾。
引用
@article{arxiv.1710.02869,
title = {An Analysis of the Value of Information when Exploring Stochastic, Discrete Multi-Armed Bandits},
author = {Isaac J. Sledge and Jose C. Principe},
journal= {arXiv preprint arXiv:1710.02869},
year = {2018}
}
备注
Entropy