中文

Adaptive Sparse Softmax:一种高效且有效的 Softmax 变体

机器学习 2025-08-06 v1

摘要

Softmax 与交叉熵损失是当前神经分类模型的标准配置。目标类的黄金分数应为 1,但在 softmax 机制下这是永远无法达到的。这一问题使得训练过程无限持续并导致过拟合。此外,“目标趋近 1”的训练目标迫使模型持续学习所有样本,导致在处理一些已经以高置信度正确分类的样本时浪费时间,而测试目标仅要求每个样本的目标类获得最高分数。为解决上述缺陷,我们提出了 Adaptive Sparse softmax (AS-Softmax),它在 softmax 的基础上设计了一种合理且与测试匹配的转换。为了更有针对性地学习,我们在训练期间丢弃分数远低于实际类的类别。这样模型就可以专注于学习区分目标类与其强竞争对手,这也是测试中的巨大挑战。此外,由于简单样本在 AS-Softmax 中的训练损失会逐渐降至 0,我们开发了一种基于掩码样本比例的自适应梯度累积策略以加速训练。我们在类别数量从 5 到 5000+ 的多种文本多分类、文本多标签、文本 token 分类、图像分类和音频分类任务上验证了所提出的 AS-Softmax。结果表明,AS-Softmax 始终优于 softmax 及其变体,并且 AS-Softmax 的损失与验证时的分类性能显著相关。此外,与标准 softmax 相比,自适应梯度累积策略在保持分类有效性的同时,可带来约 1.2 倍的训练加速。

关键词

引用

@article{arxiv.2508.03175,
  title  = {Adaptive Sparse Softmax: An Effective and Efficient Softmax Variant},
  author = {Qi Lv and Lei Geng and Ziqiang Cao and Min Cao and Sujian Li and Wenjie Li and Guohong Fu},
  journal= {arXiv preprint arXiv:2508.03175},
  year   = {2025}
}

备注

Accept by IEEE TASLP (Early accept version)