中文

基于双粒度Sinkhorn蒸馏的长尾噪声数据学习提升

机器学习 2025-10-10 v1 计算机视觉与模式识别

摘要

深度学习的真实数据集常常面临类别不平衡和标签噪声并存的挑战,限制了模型性能。虽然已有针对每一问题的方法,但有效组合两者并非易事,因为难以区分真实的尾部样本与噪声数据,往往导致优化策略相互冲突。本文提出了一种新颖视角:不主要从零开发复杂新技术,而是探索充分利用已建立的、单独针对某一问题的「弱」辅助模型——这些模型分别擅长解决类别不平衡或标签噪声问题,但二者并非兼具。这种观点源于以下洞察:类别不平衡(分布层面的问题)与标签噪声(样本层面的问题)分别作用于不同的粒度,暗示各自的鲁棒机制可原则上在不冲突的情况下提供互补的优势。我们提出Dual-granularity Sinkhorn Distillation (D-SINK),一种新型框架,通过蒸馏和集成来整合来自此类「单用途」辅助模型的互补见解,以实现双重鲁棒性提升。具体而言,D-SINK 使用经过最优传输优化的代理标签分配,将目标模型的样本层面预测与噪声鲁棒的辅助模型对齐,将其类别分布与不平衡鲁棒的辅助模型对齐。在基准数据集上的大量实验表明,D-SINK 在从长尾噪声数据中学习方面显著提升了鲁棒性,实现了优异的实证性能。

关键词

引用

@article{arxiv.2510.08179,
  title  = {Dual-granularity Sinkhorn Distillation for Enhanced Learning from Long-tailed Noisy Data},
  author = {Feng Hong and Yu Huang and Zihua Zhao and Zhihan Zhou and Jiangchao Yao and Dongsheng Li and Ya Zhang and Yanfeng Wang},
  journal= {arXiv preprint arXiv:2510.08179},
  year   = {2025}
}

备注

25 pages, 2 figures