中文

低偏置通用标注数据集生成

计算机视觉与模式识别 2025-03-20 v3

摘要

在包含大量手动收集带类别标注图像的数据集(如 ImageNet)上进行预训练,已被证明是提升下游视觉任务泛化能力的必不可少手段。然而,这些手动收集的图像常常存在偏差,而这种偏差在类别或域之间不可迁移,从而导致模型的泛化能力退化。为缓解此问题,我们提出了一种低偏置通用标注数据集生成框架(lbGen)。我们并不通过昂贵的手动收集,而是直接生成带类别标注的低偏置图像。为实现此目标,我们提出利用多模态基础模型(如 CLIP)的优势,即在由语言定义的低偏置语义空间中对齐图像。具体地,我们开发了一种双层语义对齐损失,该损失不仅以对抗学习方式强制所有生成图像与目标数据集中所有类别的语义分布相一致,还要求每个生成图像匹配其类别名称的语义描述。此外,我们进一步将现有的图像质量评分模型转化为质量保证损失,以保持生成图像的质量。通过运用这两个损失函数,我们仅以目标数据集中所有类别名称作为输入,对预训练扩散模型进行微调,即可获得低偏置图像生成模型。实验结果表明,与手动标注数据集或其他合成数据集相比,我们生成的低偏置数据集的使用,能够在各种任务中稳定提升不同背部网络的泛化能力,尤其是在手动标注样本稀缺的任务中效果尤为显著。

关键词

引用

@article{arxiv.2412.10831,
  title  = {Low-Biased General Annotated Dataset Generation},
  author = {Dengyang Jiang and Haoyu Wang and Lei Zhang and Wei Wei and Guang Dai and Mengmeng Wang and Jingdong Wang and Yanning Zhang},
  journal= {arXiv preprint arXiv:2412.10831},
  year   = {2025}
}

备注

CVPR2025 Accepted Paper