多类分类中 bandit 信息的真实代价
机器学习
2024-06-21 v2 人工智能
机器学习
摘要
我们重访经典的多类分类问题,其中仅提供 bandit 反馈(Kakade、Shalev-Shwartz 和 Tewari,2008),即每个输入分类为 K 个可能标签之一,反馈仅限于预测标签是否正确。我们的主要关注点是关于标签数量 K 的依赖问题,以及是否存在 T 步 regret 界可以超越现有算法所显示的 依赖的可能性。我们的主要贡献在于表明,bandit 多类分类的 minimax regret 实际上更为细致,其形式为 ,其中 H 为 underlying(有限)假设类。具体而言,我们提出了一种新的 bandit 分类算法,保证 regret 为 ,该算法在中等规模的假设类上优于经典算法,并给出与上界相匹配的下界,确立了在所有参数区间内上界的紧致性(在对数因子上)。
引用
@article{arxiv.2405.10027,
title = {The Real Price of Bandit Information in Multiclass Classification},
author = {Liad Erez and Alon Cohen and Tomer Koren and Yishay Mansour and Shay Moran},
journal= {arXiv preprint arXiv:2405.10027},
year = {2024}
}