中文

三思而后决:理解资源受限下的偏好学习复杂性

机器学习 2023-12-29 v1 机器学习

摘要

我们考虑了对决老虎机(dueling bandit)设置中带有资源消耗约束的奖励最大化问题。与经典对决老虎机一样,在每一轮中,学习者必须从KK个物品集中选择一对物品,并观察当前对的相对反馈。此外,对于这两个物品,学习者还能观察到一个资源消耗向量。学习者的目标是在确保任何资源的总消耗量在分配预算内的前提下,最大化累积奖励。我们表明,由于反馈的相对性质,该问题比其老虎机对应问题更为困难,且在没有进一步假设的情况下,从最小化遗憾的角度来看该问题是不可学习的。此后,通过利用关于可用预算的假设,我们提出了一种基于 EXP3 的对决算法,该算法同时考虑了相关消耗,并证明其实现了O~(OPT(b)BK1/3T2/3)\tilde{\mathcal{O}}\left({\frac{OPT^{(b)}}{B}}K^{1/3}T^{2/3}\right)的遗憾,其中OPT(b)OPT^{(b)}是最优值,BB是可用预算。最后,我们提供了数值模拟以展示所提方法的有效性。

关键词

引用

@article{arxiv.2312.17229,
  title  = {Think Before You Duel: Understanding Complexities of Preference Learning under Constrained Resources},
  author = {Rohan Deb and Aadirupa Saha},
  journal= {arXiv preprint arXiv:2312.17229},
  year   = {2023}
}