监督学习:无损失不泣
机器学习
2020-02-11 v1 机器学习
摘要
监督学习需要指定一个待最小化的损失函数。尽管从计算和统计角度对可接受损失的理论已相当成熟,但这些理论提供了大量不同的选择。实践中,该选择通常以临时(ad hoc)方式做出。为使该过程更具原则性,为下游任务(如分类)学习损失函数的问题近期引起关注。然而,该领域的工作总体上偏经验性。本文通过新颖视角重访 Kakade 等人(2011)的 SLIsotron 算法,推导基于 Bregman 散度的推广,并展示其如何提供学习损失的原则性过程。具体而言,我们将 SLIsotron 视为从复合平方损失族中学习损失。通过恰当损失(proper losses)的视角解读,我们推导出基于 Bregman 散度的 SLIsotron 推广。所得的 BregmanTron 算法联合学习损失与分类器。它附带对所学习损失的简单收敛保证,且其可能输出集合附带对 Bayes 规则的不可知可逼近性保证。实验表明 BregmanTron 大幅优于 SLIsotron,且其学习的损失可被其他算法用于不同任务最小化,从而开启了损失跨域迁移(loss transfer)这一有趣问题。
引用
@article{arxiv.2002.03555,
title = {Supervised Learning: No Loss No Cry},
author = {Richard Nock and Aditya Krishna Menon},
journal= {arXiv preprint arXiv:2002.03555},
year = {2020}
}