多臂老虎机中探索策略的多样性驱动选择
机器学习
2018-08-24 v1 人工智能
机器学习
摘要
我们考虑这样一种场景:智能体拥有多种可用策略来探索未知环境。对于每一次与环境的新交互,智能体必须选择使用哪种探索策略。我们提出了一种与具体策略无关的新方法,将这种情况视为多臂老虎机问题,其中奖励信号是每种策略所产生的效应的多样性。我们在模拟的平面机械臂上对该方法进行了实证测试,并证实该方法既能够区分质量不同的策略(即使差异十分细微),且其最终性能可与最佳固定策略混合相媲美。
引用
@article{arxiv.1808.07739,
title = {Diversity-Driven Selection of Exploration Strategies in Multi-Armed Bandits},
author = {Fabien C. Y. Benureau and Pierre-Yves Oudeyer},
journal= {arXiv preprint arXiv:1808.07739},
year = {2018}
}