中文

元学习对抗赌博机算法

机器学习 2023-11-02 v2 人工智能 机器学习

摘要

我们研究带赌博机反馈的在线元学习,目标是在多个任务若依某自然相似性度量相似时提升跨任务性能。作为首个针对对抗性在线套在线部分信息设置的工作,我们设计了元算法,结合外部学习器同时为内部学习器调节初始化与其他超参数,涵盖两个重要情形:多臂赌博机(MAB)与赌博机线性优化(BLO)。对MAB,元学习器初始化并设定Exp3的Tsallis熵推广的超参数,当后验最优的熵较小时任务平均后悔得以改善。对BLO,我们学习初始化并调节带自协和障碍正则化子的在线镜像下降(OMD),表明任务平均后悔随其诱导的依赖于动作空间的度量直接变化。我们的保证依赖于证明:未正则化跟随领导者结合两级低维超参数调节,足以学习一系列以非Lipschitz且有时非凸的Bregman散度(界定OMD后悔)为界的仿射函数。

关键词

引用

@article{arxiv.2307.02295,
  title  = {Meta-Learning Adversarial Bandit Algorithms},
  author = {Mikhail Khodak and Ilya Osadchiy and Keegan Harris and Maria-Florina Balcan and Kfir Y. Levy and Ron Meir and Zhiwei Steven Wu},
  journal= {arXiv preprint arXiv:2307.02295},
  year   = {2023}
}

备注

Merger of arXiv:2205.14128 and arXiv:2205.15921, with some additional improvements; to appear in NeurIPS 2023