中文

基于理论支撑损失函数的改进平衡分类

机器学习 2026-01-01 v1 机器学习

摘要

平衡损失是类别不平衡下多类分类广泛采用的目标。通过赋予所有类别同等重要性(无论其频率如何),它促进了公平性并确保少数类不被忽视。然而,直接最小化平衡分类损失通常是困难的,这使得设计有效的替代损失成为一个核心问题。本文引入并研究了两个先进的替代损失族:广义 Logit 调整(GLA)损失函数和广义类感知加权(GCA)损失。GLA 损失将基于类先验移动 logit 的 Logit-Adjusted 损失推广到更广泛的一般交叉熵损失族。GCA 损失函数通过引入类相关置信度边际并将其扩展到一般交叉熵族,扩展了按类频率逆比例缩放损失的标准类加权损失。我们对两个损失族的一致性进行了全面的理论分析。我们表明 GLA 损失是 Bayes 一致的,但仅对完备(即无界)假设集是 HH-一致的。此外,它们的 HH-一致性界与最小类概率成反比,缩放比例至少为 1/pmin1/\mathsf p_{\min}。相比之下,GCA 损失对任何有界或完备的假设集都是 HH-一致的,其 HH-一致性界以 1/pmin1/\sqrt{\mathsf p_{\min}} 的比例更为有利地缩放,在不平衡设置中提供了显著更强的理论保证。我们报告了实验结果,证明在经验上,带有校准的类相关置信度边际的 GCA 损失和 GLA 损失都能大大优于直接的类加权损失以及 LA 损失。GLA 在常见基准中通常表现略好,而 GCA 在高度不平衡设置中略占优势。

关键词

引用

@article{arxiv.2512.23947,
  title  = {Improved Balanced Classification with Theoretically Grounded Loss Functions},
  author = {Corinna Cortes and Mehryar Mohri and Yutao Zhong},
  journal= {arXiv preprint arXiv:2512.23947},
  year   = {2026}
}

备注

NeurIPS 2025