中文

超越 logit 调整:面向长尾重排序的残差分解框架

机器学习 2026-04-03 v1

摘要

长尾分类是一种小数量的频繁类别主导许多稀有类别的任务,因为模型在推断时系统性地偏好频繁类别。现有的后处理方法如 logit 调整通过向基本模型的 logits 添加固定的类别相关偏移来解决这一问题。然而,恢复两个类别相对排序所需的修正不一定在不同输入下保持恒定,固定的偏移无法适应这种变化。我们通过在基本模型的top-k短列表上进行 bayes 最优重排序来研究这一问题。最优得分与基本得分之间的差值——残差校正——分解为在每个类别内恒定的类别相关分量,以及依赖于输入和竞争标签的两两相关分量。当残差纯粹为类别相关时,固定偏移足以恢复bayes 最优排序。我们进一步表明,当同一标签对在不同情境下引起不兼容的排序约束时,任何固定偏移都无法实现这一恢复。这种分解导致关于何时可以使用两两校正来改进性能以及何时只能使用类别相关校正的可测试预测。我们开发了REPAIR(通过两两残差校正进行重排序),一种轻量级后处理重排序器,结合收缩稳定的类别相关项与由竞争特征驱动的线性两两项。实验在覆盖图像分类、物种识别、场景识别和罕见疾病诊断的五个基准数据集上确认,分解解释了两两校正有效且仅在类别相关校正alone足以恢复排序的情境。

关键词

引用

@article{arxiv.2604.01506,
  title  = {Beyond Logit Adjustment: A Residual Decomposition Framework for Long-Tailed Reranking},
  author = {Zhanliang Wang and Hongzhuo Chen and Quan Minh Nguyen and Mian Umair Ahsan and Kai Wang},
  journal= {arXiv preprint arXiv:2604.01506},
  year   = {2026}
}

备注

Preprint