基于信息价值策略的吃豆人小姐智能体专业技能分析
机器学习
2018-02-20 v3 人工智能
信息论
math.IT
摘要
传统的马尔可夫决策过程强化学习方法依赖弱引导的随机搜索来驱动学习过程,因此难以预测智能体可能涌现的行为。本文考虑一种信息论代价函数,用于执行受约束的随机搜索,以促进从风险规避到风险偏好行为的形成。该代价函数即信息价值,它提供了策略期望回报与策略复杂度之间的最优权衡;策略复杂度以比特数度量,并由代价函数上的单个超参数控制。当策略复杂度降低时,智能体将日益规避风险行为,这降低了获得高累积奖励的潜力。当策略复杂度增加时,智能体将不顾风险采取能提升长期奖励的行动。可获得的奖励取决于一个调节策略复杂度程度的单一可调超参数。我们在随机版吃豆人小姐游戏上评估了基于信息价值策略的性能。本文的一个主要组成部分是展示策略复杂度值的不同范围如何产生不同的游戏风格,并解释其原因。我们还表明,我们的强化学习搜索机制比我们使用的其他机制更高效。这一结果意味着信息价值理论适用于刻画强化学习中利用-探索的权衡。
引用
@article{arxiv.1702.08628,
title = {Analysis of Agent Expertise in Ms. Pac-Man using Value-of-Information-based Policies},
author = {Isaac J. Sledge and Jose C. Principe},
journal= {arXiv preprint arXiv:1702.08628},
year = {2018}
}
备注
IEEE Transactions on Computational Intelligence and Artificial Intelligence in Games