中文

多类分类中 bandit 信息的真实代价

机器学习 2024-06-21 v2 人工智能 机器学习

摘要

我们重访经典的多类分类问题,其中仅提供 bandit 反馈(Kakade、Shalev-Shwartz 和 Tewari,2008),即每个输入分类为 K 个可能标签之一,反馈仅限于预测标签是否正确。我们的主要关注点是关于标签数量 K 的依赖问题,以及是否存在 T 步 regret 界可以超越现有算法所显示的 KT\sqrt{KT} 依赖的可能性。我们的主要贡献在于表明,bandit 多类分类的 minimax regret 实际上更为细致,其形式为 Θ~(min{H+T,KTlogH})\widetilde{\Theta}\left(\min \left\{|H| + \sqrt{T}, \sqrt{KT \log |H|} \right\} \right),其中 H 为 underlying(有限)假设类。具体而言,我们提出了一种新的 bandit 分类算法,保证 regret 为 O~(H+T)\widetilde{O}(|H|+\sqrt{T}),该算法在中等规模的假设类上优于经典算法,并给出与上界相匹配的下界,确立了在所有参数区间内上界的紧致性(在对数因子上)。

关键词

引用

@article{arxiv.2405.10027,
  title  = {The Real Price of Bandit Information in Multiclass Classification},
  author = {Liad Erez and Alon Cohen and Tomer Koren and Yishay Mansour and Shay Moran},
  journal= {arXiv preprint arXiv:2405.10027},
  year   = {2024}
}