中文

广义 KL 散度损失

机器学习 2025-03-12 v1 人工智能 计算机视觉与模式识别

摘要

本文深入探讨了 Kullback-Leibler (KL) 散度损失,并数学证明其等价于解耦 Kullback-Leibler (DKL) 散度损失,后者由 (1) 加权均方误差 (wMSE) 损失和 (2) 包含软标签的交叉熵损失组成。得益于 DKL 损失的解耦结构,我们识别出两个可以改进的方面。首先,我们针对知识蒸馏等场景中的 KL 损失局限性,通过打破其沿着不对称优化属性的限制,并引入更平滑的权函数。这种修改有效缓解了在优化中出现的挑战,尤其是针对软标签中高预测得分类的挑战。其次,我们将类级全局信息引入 KL/DKL,以减少由单个样本引起的偏差。通过这两个改进,我们推导出广义 Kullback-Leibler (GKL) 散度损失,并通过在 CIFAR-10/100、ImageNet 和视觉语言数据集上进行实验评估其有效性,关注对抗训练和知识蒸馏任务。具体而言,我们在公开排行榜 -- RobustBench 上的对抗鲁棒性取得新纪录,同时在 CIFAR/ImageNet 模型和 CLIP 模型上实现知识蒸馏的竞争性能,充分展示了其实际价值。我们的代码已公开于 https://github.com/jiequancui/DKL。

关键词

引用

@article{arxiv.2503.08038,
  title  = {Generalized Kullback-Leibler Divergence Loss},
  author = {Jiequan Cui and Beier Zhu and Qingshan Xu and Zhuotao Tian and Xiaojuan Qi and Bei Yu and Hanwang Zhang and Richang Hong},
  journal= {arXiv preprint arXiv:2503.08038},
  year   = {2025}
}

备注

extension of our NeurIPS paper "Decoupled Kullback-Leibler Divergence Loss". arXiv admin note: substantial text overlap with arXiv:2305.13948