多类在线分类中 Bandit 信息的代价
机器学习
2013-07-10 v2
摘要
我们考虑假设类 的多类在线学习的两种情景。在{\em 全信息}情景中,学习者接触到实例及其标签。在{\em bandit}情景中,真实标签未被暴露,而是仅指示学习者的预测是否正确。我们表明,在可实现情况下,两种情景下的错误率之比至多为 ,而在不可知情况下为 。这些结果在对数因子内是紧的,并实质上回答了 (Daniely et. al. - Multiclass learnability and the erm principle) 中的一个开放性问题。我们将这些结果应用于 中的 -间隔多类线性分类器类。我们表明,该类在可实现情况下的 bandit 错误率为 ,在不可知情况下为 。这解决了 (Kakade et. al. - Efficient bandit algorithms for online multiclass prediction) 中的一个开放性问题。
引用
@article{arxiv.1302.1043,
title = {The price of bandit information in multiclass online classification},
author = {Amit Daniely and Tom Helbertal},
journal= {arXiv preprint arXiv:1302.1043},
year = {2013}
}