面向不平衡分类的反馈引导数据合成
计算机视觉与模式识别
2024-09-11 v2 人工智能
机器学习
摘要
机器学习当前的惯常做法是使用静态的真实图像数据集进行训练,这类数据往往来自长尾分布。随着生成模型的最新进展,研究者已开始用合成数据扩充这些静态数据集,并在分类任务上报告了适度的性能提升。我们假设这些性能增益受限于缺乏从分类器到生成模型的反馈,而此类反馈本可促进生成样本对提升分类器性能的有用性。本工作中,我们引入一种用有用合成样本扩充静态数据集的框架,其利用分类器的单次反馈来驱动生成模型的采样。为使该框架有效,我们发现样本必须接近当前任务真实数据的支撑集,且具备充分多样性。我们在长尾数据集(ImageNet-LT)以及组不平衡数据集(NICO++)上验证了三种反馈准则。在 ImageNet-LT 上,我们取得了最先进的结果,在代表性不足类别上提升超过 4%,同时生成合成样本数量仅需一半。NICO++ 在最差组准确率上也获得超过 5% 的显著提升。这些结果表明,我们的框架为有效利用最先进的文本到图像模型作为数据源、并借以查询改进下游应用铺平了道路。
引用
@article{arxiv.2310.00158,
title = {Feedback-guided Data Synthesis for Imbalanced Classification},
author = {Reyhane Askari Hemmat and Mohammad Pezeshki and Florian Bordes and Michal Drozdzal and Adriana Romero-Soriano},
journal= {arXiv preprint arXiv:2310.00158},
year = {2024}
}