DART:用于非线性 top-K 子集识别的自适应接受-拒绝算法
机器学习
2026-02-16 v2 机器学习
摘要
我们考虑在每步从 个臂中选择 个的多臂 bandit 问题。奖励可以是所选单个臂奖励的非线性函数。直接使用多臂 bandit 算法需在 个选项中选择,使得动作空间巨大。为简化问题,现有组合 bandit 研究{通常}假设反馈为单个奖励的线性函数。本文中,我们证明了具有可能相关奖励的 top- 子集选择的 bandit 反馈下界。我们提出了一种用于组合场景的新算法,无需使用单个臂反馈也不要求奖励函数线性。此外,我们的算法适用于单个臂的相关奖励。我们的算法 aDaptive Accept RejecT (DART) 基于置信界依次寻找好臂并淘汰差臂。DART 计算高效且存储关于 线性。进一步,DART 在时长 下达到 的 regret 界,该界在因子 内匹配 bandit 反馈下界。当应用于交叉销售优化和最大化单个奖励均值问题时,所提算法性能超越 SOTA 算法。我们还展示了 DART 在线性与非线性联合奖励环境下均显著优于现有方法。
引用
@article{arxiv.2011.07687,
title = {DART: aDaptive Accept RejecT for non-linear top-K subset identification},
author = {Mridul Agarwal and Vaneet Aggarwal and Christopher J. Quinn and Abhishek Umrawal},
journal= {arXiv preprint arXiv:2011.07687},
year = {2026}
}
备注
extended version of AAAI 2021 paper