交叉熵与期望损失项之间的混合
机器学习
2021-09-14 v1
摘要
交叉熵损失因其有效性和坚实的理论基础而被广泛使用。然而,随着训练推进,该损失倾向于关注难以分类的样本,这可能阻碍网络获得性能提升。尽管该领域多数工作提出了分类困难负样本的方法,我们建议策略性地搁置困难负样本,以聚焦于具有较高概率的误分类样本。我们表明,在优化目标中加入期望损失(它是零一损失的更好近似)有助于网络取得更好的准确率。因此,我们提出在训练期间于两种损失间切换,在训练后期逐步更多地关注期望损失。我们的实验表明,这一新训练协议在包括计算机视觉、自然语言处理、表格数据和序列在内的多种分类领域中提升了性能。我们的代码与脚本可在补充材料中获取。
引用
@article{arxiv.2109.05635,
title = {Mixing between the Cross Entropy and the Expectation Loss Terms},
author = {Barak Battash and Lior Wolf and Tamir Hazan},
journal= {arXiv preprint arXiv:2109.05635},
year = {2021}
}
备注
8 pages, 3 figures