使用自助法观测样本学习帕累托前沿
机器学习
2024-05-24 v2 机器学习
摘要
我们考虑线性_bandit_的帕累托前沿辨识(PFILin),即目标是当均值奖励向量是上下文的线性函数时,辨识具有未被占优均值奖励向量的一组臂。PFILin 包含最佳臂辨识问题与多目标主动学习作为特例。我们提出算法的样本复杂度在至多对数因子内是最优的。此外,我们的算法在估计期间产生的后悔度,在所有辨识帕累托前沿的算法的最优后悔度对数因子之内。我们的关键贡献是一种新估计量,它在每一轮沿多个上下文方向更新对未知参数的估计——这与仅沿所选上下文更新参数估计的传统估计量相反。这使我们能利用低后悔臂收集关于帕累托最优臂的信息。我们的关键创新是多次重用探索样本;而传统估计量每个样本仅用一次。数值实验表明,所提算法在控制后悔度的同时成功辨识了帕累托前沿。
引用
@article{arxiv.2306.00096,
title = {Learning the Pareto Front Using Bootstrapped Observation Samples},
author = {Wonyoung Kim and Garud Iyengar and Assaf Zeevi},
journal= {arXiv preprint arXiv:2306.00096},
year = {2024}
}
备注
37 pages including appendix