中文

面向简单后悔最小化的元学习

机器学习 2023-07-06 v2 人工智能 机器学习

摘要

我们为赌博机中的简单后悔最小化开发了一个元学习框架。在该框架中,学习智能体与一系列赌博机任务交互,这些任务从未知先验分布中独立同分布采样,并学习其元参数以在未来任务上表现更好。我们提出了该设定下的首个贝叶斯与频率主义元学习算法。贝叶斯算法可访问元参数上的先验分布,其在具有时域长度 nnmm 个赌博机任务上的元简单后悔仅为 O~(m/n)\tilde{O}(m / \sqrt{n})。另一方面,频率主义算法的元简单后悔为 O~(mn+m/n)\tilde{O}(\sqrt{m} n + m/ \sqrt{n})。尽管其后悔更差,频率主义算法更为通用,因为它不需要元参数上的先验分布。它也可在更多设定中分析。我们针对几类赌博机问题实例化了我们的算法。我们的算法具有通用性,并通过在多个环境中进行实证评估来补充我们的理论。

关键词

引用

@article{arxiv.2202.12888,
  title  = {Meta-Learning for Simple Regret Minimization},
  author = {Mohammadjavad Azizi and Branislav Kveton and Mohammad Ghavamzadeh and Sumeet Katariya},
  journal= {arXiv preprint arXiv:2202.12888},
  year   = {2023}
}