中文

面对长尾分布的基础模型偏差再思考

机器学习 2025-08-11 v3 计算机视觉与模式识别 机器学习

摘要

长尾学习因其实际意义而受到日益关注。在各种方法中,微调范式因基础模型的出现而受到广泛关注。然而,大多数现有方法主要关注利用这些模型的知识,忽略了其所依赖的不平衡训练数据所固有的偏差。在本文中,我们检查了预训练中的不平衡如何影响长尾下游任务。具体而言,我们发现基础模型在下游任务中继承的不平衡偏差表现为参数不平衡和数据不平衡。在微调期间,我们观察到参数不平衡发挥更关键的作用,而数据不平衡可以使用现有的再平衡策略来缓解。此外,我们发现参数不平衡无法通过当前的再平衡技术(如在训练期间调整 logits)有效解决,与数据不平衡不同。为同时解决这两种不平衡,我们基于因果学习,将不完整语义因素视为混杂因子,这会在输入样本与标签之间引入伪相关。为解决这一问题,我们提出了一种新颖的背门调整方法,通过学习输入样本与标签之间的真实因果效应,而不仅仅是拟合数据中的相关性。值得注意的是,我们在每个数据集上实现了约 1.67%1.67\% 的平均性能提升。代码已公开:https://github.com/JiahaoChen1/Pre-train-Imbalance

关键词

引用

@article{arxiv.2501.15955,
  title  = {Rethinking the Bias of Foundation Model under Long-tailed Distribution},
  author = {Jiahao Chen and Bin Qin and Jiangmeng Li and Hao Chen and Bing Su},
  journal= {arXiv preprint arXiv:2501.15955},
  year   = {2025}
}

备注

Published as a conference paper in ICML 2025