解耦的Kullback-Leibler散度损失
计算机视觉与模式识别
2024-10-29 v3 机器学习
摘要
本文深入探究Kullback-Leibler(KL)散度损失,并从数学上证明其等价于解耦的Kullback-Leibler(DKL)散度损失,后者由1)加权均方误差(wMSE)损失与2)融入软标签的交叉熵损失组成。得益于DKL损失的分解形式,我们确定了两个可改进的方向。首先,我们通过打破KL/DKL在知识蒸馏等场景中的非对称优化特性,解决了其局限性。该修改确保MSE分量在训练期间始终有效,提供额外的建设性线索。其次,我们将类级全局信息引入KL/DKL,以减轻个体样本的偏差。结合这两点改进,我们推导出改进的Kullback-Leibler(IKL)散度损失,并在CIFAR-10/100与ImageNet数据集上开展实验评估其有效性,重点关注对抗训练与知识蒸馏任务。所提方法在公开排行榜RobustBench上取得了新的最先进对抗鲁棒性,并在知识蒸馏上表现出具竞争力的性能,展现了显著的实用价值。我们的代码见 https://github.com/jiequancui/DKL。
引用
@article{arxiv.2305.13948,
title = {Decoupled Kullback-Leibler Divergence Loss},
author = {Jiequan Cui and Zhuotao Tian and Zhisheng Zhong and Xiaojuan Qi and Bei Yu and Hanwang Zhang},
journal= {arXiv preprint arXiv:2305.13948},
year = {2024}
}
备注
NeurIPS 2024