通过采样合成数据在潜在空间中实现高效长尾学习
机器学习
2025-09-22 v1 计算机视觉与模式识别
摘要
不平衡的分类数据集给机器学习带来了重大挑战,往往导致模型产生偏差,在代表性不足的类别上表现不佳。随着基础模型的兴起,近期研究集中在对这些模型进行全量、部分和参数高效微调,以处理长尾分类问题。尽管这些工作在基准数据集上表现出色,但它们仍未能弥合与使用平衡数据集训练的网络之间的差距,并且即使对于相对较小的数据集,仍需消耗大量计算资源。鉴于计算效率与简洁性的重要性,在本工作中,我们提出了一个新颖的框架,该框架利用视觉基础模型丰富的语义潜在空间生成合成数据,并使用真实数据与合成数据的混合来训练一个简单的线性分类器,以用于长尾分类。计算效率的提升源于可训练参数的数量被减少至仅线性模型中的参数数量。我们的方法在 CIFAR-100-LT 基准上创造了新的 SOTA,并在 Places-LT 基准上表现出强劲的性能,突显了我们这一简单有效方法的有效性与适应性。
引用
@article{arxiv.2509.15859,
title = {Efficient Long-Tail Learning in Latent Space by sampling Synthetic Data},
author = {Nakul Sharma},
journal= {arXiv preprint arXiv:2509.15859},
year = {2025}
}
备注
Accepted to Curated Data for Efficient Learning Workshop at ICCV 2025