中文

解耦的Kullback-Leibler散度损失

计算机视觉与模式识别 2024-10-29 v3 机器学习

摘要

本文深入探究Kullback-Leibler(KL)散度损失,并从数学上证明其等价于解耦的Kullback-Leibler(DKL)散度损失,后者由1)加权均方误差(wMSE)损失与2)融入软标签的交叉熵损失组成。得益于DKL损失的分解形式,我们确定了两个可改进的方向。首先,我们通过打破KL/DKL在知识蒸馏等场景中的非对称优化特性,解决了其局限性。该修改确保w\mathbf{w}MSE分量在训练期间始终有效,提供额外的建设性线索。其次,我们将类级全局信息引入KL/DKL,以减轻个体样本的偏差。结合这两点改进,我们推导出改进的Kullback-Leibler(IKL)散度损失,并在CIFAR-10/100与ImageNet数据集上开展实验评估其有效性,重点关注对抗训练与知识蒸馏任务。所提方法在公开排行榜RobustBench上取得了新的最先进对抗鲁棒性,并在知识蒸馏上表现出具竞争力的性能,展现了显著的实用价值。我们的代码见 https://github.com/jiequancui/DKL。

关键词

引用

@article{arxiv.2305.13948,
  title  = {Decoupled Kullback-Leibler Divergence Loss},
  author = {Jiequan Cui and Zhuotao Tian and Zhisheng Zhong and Xiaojuan Qi and Bei Yu and Hanwang Zhang},
  journal= {arXiv preprint arXiv:2305.13948},
  year   = {2024}
}

备注

NeurIPS 2024