中文

数据集意识还不够:长尾自监督学习中的样本级尾部激励

计算机视觉与模式识别 2024-11-19 v2 人工智能

摘要

自监督学习(SSL)在广泛的数据集上展现了显著的数据表示能力。然而,当应用于具有长尾分布的真实世界数据集时,多个下游任务的性能显著下降。最近,研究社区开始更多地关注自监督长尾学习。一些工作尝试将温度机制转移到自监督学习中,或使用类别空间均匀约束来平衡嵌入空间中不同类别的表示,以对抗长尾分布。然而,这些方法大多关注数据集中所有样本的联合优化或约束类别分布,而对每个单独样本在训练过程中是否得到最优引导关注甚少。为解决这一问题,我们提出了温度辅助样本级激励(TASE)。我们将伪标签引入自监督长尾学习,利用伪标签信息驱动动态温度和重加权策略。具体而言,我们为每个样本分配一个最优温度参数。此外,我们分析了温度参数中数量意识的缺失,并使用重加权来弥补这一缺陷,从而在样本层面实现最优训练模式。在三个数据集上的六个基准测试的全面实验结果表明,我们的方法在改善长尾识别方面取得了出色性能,同时也表现出高鲁棒性。

关键词

引用

@article{arxiv.2410.22883,
  title  = {Dataset Awareness is not Enough: Implementing Sample-level Tail Encouragement in Long-tailed Self-supervised Learning},
  author = {Haowen Xiao and Guanghui Liu and Xinyi Gao and Yang Li and Fengmao Lv and Jielei Chu},
  journal= {arXiv preprint arXiv:2410.22883},
  year   = {2024}
}