中文

有限模型集下多臂老虎机中的顺序迁移

机器学习 2013-07-29 v1 机器学习

摘要

从先验任务中学习并迁移经验以提升未来性能,对于构建终身学习智能体至关重要。尽管监督学习和强化学习的结果表明迁移可显著提升学习性能,但大多数关于迁移的文献集中于批量学习任务。本文研究在线学习中的顺序迁移问题,特别是在多臂老虎机框架下,其目标是通过增量式迁移先验任务的知识,最小化一系列任务上的累积遗憾。我们提出了一种基于矩估计法来估计可能任务的新型老虎机算法,并推导了其遗憾界。

关键词

引用

@article{arxiv.1307.6887,
  title  = {Sequential Transfer in Multi-armed Bandit with Finite Set of Models},
  author = {Mohammad Gheshlaghi Azar and Alessandro Lazaric and Emma Brunskill},
  journal= {arXiv preprint arXiv:1307.6887},
  year   = {2013}
}