探索与利用最优平衡的Infomax策略
机器学习
2016-05-25 v1 信息论
math.IT
数据分析、统计与概率
种群与进化
机器学习
摘要
利用与探索之间的恰当平衡是做出好决策的关键,这类决策能获得高回报如收益或进化适应度。信息最大化(Infomax)原则假设信息的最大化指导着从生命系统到人工神经网络等不同系统的功能。尽管特定应用成功,但信息作为回报代理的有效性仍不清楚。在此,我们考虑多臂老虎机决策问题,其特征是具有未知成功概率的臂(老虎机)以及试图通过选择要玩的臂序列来最大化累积收益的玩家。我们展示了一种Infomax策略(Info-p),它最优地收集关于各臂间最高平均回报的信息,达到了已知最优界,并且优于现有策略。Info-p考虑的最高平均回报并非选择要玩的臂实际所需量,但它允许在探索与利用间进行最优权衡。
引用
@article{arxiv.1601.03073,
title = {Infomax strategies for an optimal balance between exploration and exploitation},
author = {Gautam Reddy and Antonio Celani and Massimo Vergassola},
journal= {arXiv preprint arXiv:1601.03073},
year = {2016}
}
备注
16 pages, 5 figures