中文

多臂老虎机中探索策略的多样性驱动选择

机器学习 2018-08-24 v1 人工智能 机器学习

摘要

我们考虑这样一种场景:智能体拥有多种可用策略来探索未知环境。对于每一次与环境的新交互,智能体必须选择使用哪种探索策略。我们提出了一种与具体策略无关的新方法,将这种情况视为多臂老虎机问题,其中奖励信号是每种策略所产生的效应的多样性。我们在模拟的平面机械臂上对该方法进行了实证测试,并证实该方法既能够区分质量不同的策略(即使差异十分细微),且其最终性能可与最佳固定策略混合相媲美。

关键词

引用

@article{arxiv.1808.07739,
  title  = {Diversity-Driven Selection of Exploration Strategies in Multi-Armed Bandits},
  author = {Fabien C. Y. Benureau and Pierre-Yves Oudeyer},
  journal= {arXiv preprint arXiv:1808.07739},
  year   = {2018}
}