三思而后决:理解资源受限下的偏好学习复杂性
机器学习
2023-12-29 v1 机器学习
摘要
我们考虑了对决老虎机(dueling bandit)设置中带有资源消耗约束的奖励最大化问题。与经典对决老虎机一样,在每一轮中,学习者必须从个物品集中选择一对物品,并观察当前对的相对反馈。此外,对于这两个物品,学习者还能观察到一个资源消耗向量。学习者的目标是在确保任何资源的总消耗量在分配预算内的前提下,最大化累积奖励。我们表明,由于反馈的相对性质,该问题比其老虎机对应问题更为困难,且在没有进一步假设的情况下,从最小化遗憾的角度来看该问题是不可学习的。此后,通过利用关于可用预算的假设,我们提出了一种基于 EXP3 的对决算法,该算法同时考虑了相关消耗,并证明其实现了的遗憾,其中是最优值,是可用预算。最后,我们提供了数值模拟以展示所提方法的有效性。
引用
@article{arxiv.2312.17229,
title = {Think Before You Duel: Understanding Complexities of Preference Learning under Constrained Resources},
author = {Rohan Deb and Aadirupa Saha},
journal= {arXiv preprint arXiv:2312.17229},
year = {2023}
}