中文

为长尾学习重振欠采样

计算机视觉与模式识别 2024-01-31 v1

摘要

长尾识别中使用的训练数据集极度不平衡,导致各类别间的准确率存在显著差异。先前的工作大多使用平均准确率来评估其算法,这很容易忽略那些表现最差的类别。在本文中,我们旨在提高表现最差类别的准确率,并利用调和平均和几何平均来评估模型性能。我们重振了平衡欠采样的思想来实现这一目标。在小样本学习中,平衡子集是小样本的,必然会导致欠拟合,因此它未被用于现代长尾学习。但我们发现,它能在各类别间产生更公平的准确率分布,具有更高的调和平均和几何平均准确率,但平均准确率较低。此外,我们设计了一种直接的模型集成策略,该策略不会产生任何额外开销,并且与最先进的长尾学习方法相比,在保持平均准确率几乎不变的同时,实现了更高的调和平均和几何平均。我们在广泛使用的长尾学习基准数据集上验证了我们方法的有效性。我们的代码位于\href{https://github.com/yuhao318/BTM/}{https://github.com/yuhao318/BTM/}。

关键词

引用

@article{arxiv.2401.16811,
  title  = {Reviving Undersampling for Long-Tailed Learning},
  author = {Hao Yu and Yingxiao Du and Jianxin Wu},
  journal= {arXiv preprint arXiv:2401.16811},
  year   = {2024}
}