主动推断在多臂老虎机中的实证评估
机器学习
2021-08-27 v4
摘要
不确定性下序贯决策的一个关键特征是需要平衡利用——根据当前知识选择最佳动作,与探索——获取其他动作价值的信息。多臂老虎机问题是一个捕捉这种权衡的经典任务,在机器学习中作为开发老虎机算法的载体,这些算法已被证明在众多工业应用中很有用。主动推断框架是神经科学中最近为理解人类和动物行为而开发的序贯决策方法,其特点在于解决探索-利用权衡的复杂策略。这使得主动推断成为已确立的老虎机算法的一个令人兴奋的替代方案。在此我们推导了一种高效且可扩展的近似主动推断算法,并将其与两种最先进(SOTA)的老虎机算法进行比较:贝叶斯上置信界和乐观 Thompson 采样。该比较在两类老虎机问题上进行:平稳老虎机和动态切换老虎机。我们的实证评估表明,主动推断算法在平稳老虎机中不能产生高效的长期行为。然而,在更具挑战性的切换老虎机问题中,主动推断的表现明显优于两种最先进的老虎机算法。这些结果为理论和应用机器学习的进一步研究开辟了令人兴奋的途径,也为主动推断作为研究人类和动物行为的一般框架增添了可信度。
引用
@article{arxiv.2101.08699,
title = {An empirical evaluation of active inference in multi-armed bandits},
author = {Dimitrije Markovic and Hrvoje Stojic and Sarah Schwoebel and Stefan J. Kiebel},
journal= {arXiv preprint arXiv:2101.08699},
year = {2021}
}