面向简单后悔最小化的元学习
机器学习
2023-07-06 v2 人工智能
机器学习
摘要
我们为赌博机中的简单后悔最小化开发了一个元学习框架。在该框架中,学习智能体与一系列赌博机任务交互,这些任务从未知先验分布中独立同分布采样,并学习其元参数以在未来任务上表现更好。我们提出了该设定下的首个贝叶斯与频率主义元学习算法。贝叶斯算法可访问元参数上的先验分布,其在具有时域长度 的 个赌博机任务上的元简单后悔仅为 。另一方面,频率主义算法的元简单后悔为 。尽管其后悔更差,频率主义算法更为通用,因为它不需要元参数上的先验分布。它也可在更多设定中分析。我们针对几类赌博机问题实例化了我们的算法。我们的算法具有通用性,并通过在多个环境中进行实证评估来补充我们的理论。
引用
@article{arxiv.2202.12888,
title = {Meta-Learning for Simple Regret Minimization},
author = {Mohammadjavad Azizi and Branislav Kveton and Mohammad Ghavamzadeh and Sumeet Katariya},
journal= {arXiv preprint arXiv:2202.12888},
year = {2023}
}