中文

使用自助法观测样本学习帕累托前沿

机器学习 2024-05-24 v2 机器学习

摘要

我们考虑线性_bandit_的帕累托前沿辨识(PFILin),即目标是当均值奖励向量是上下文的线性函数时,辨识具有未被占优均值奖励向量的一组臂。PFILin 包含最佳臂辨识问题与多目标主动学习作为特例。我们提出算法的样本复杂度在至多对数因子内是最优的。此外,我们的算法在估计期间产生的后悔度,在所有辨识帕累托前沿的算法的最优后悔度对数因子之内。我们的关键贡献是一种新估计量,它在每一轮沿多个上下文方向更新对未知参数的估计——这与仅沿所选上下文更新参数估计的传统估计量相反。这使我们能利用低后悔臂收集关于帕累托最优臂的信息。我们的关键创新是多次重用探索样本;而传统估计量每个样本仅用一次。数值实验表明,所提算法在控制后悔度的同时成功辨识了帕累托前沿。

关键词

引用

@article{arxiv.2306.00096,
  title  = {Learning the Pareto Front Using Bootstrapped Observation Samples},
  author = {Wonyoung Kim and Garud Iyengar and Assaf Zeevi},
  journal= {arXiv preprint arXiv:2306.00096},
  year   = {2024}
}

备注

37 pages including appendix