面向零样本多标签分类的多样化定制图像生成
计算机视觉与模式识别
2024-04-05 v1
摘要
近年来,零样本多标签分类因能够在无需人工标注的情况下对未见标签进行预测而备受关注。然而,现有方法通常将已见类作为未见类的不完美代理,导致性能次优。受文本到图像生成模型在生成逼真图像方面取得成功的启发,我们提出了一种创新的解决方案:生成合成数据,以构建明确为无代理未见标签训练量身定制的训练集。我们的方法引入了一个新颖的图像生成框架,该框架生成未见类的多标签合成图像用于分类器训练。为了增强生成图像的多样性,我们利用预训练的大型语言模型生成多样化的提示。采用预训练的多模态 CLIP 模型作为判别器,我们评估生成的图像是否准确表示了目标类。这使得能够自动过滤不准确生成的图像,从而保持分类器准确率。为了优化文本提示以实现更精确有效的多标签对象生成,我们引入了基于 CLIP 分数的判别损失来微调扩散模型中的文本编码器。此外,为了在保持原始特征泛化能力的同时增强目标任务的视觉特征,并减轻微调整个视觉编码器导致的灾难性遗忘,我们提出了一种受 Transformer 注意力机制启发的特征融合模块。该模块有助于更有效地捕获多个对象之间的全局依赖关系。大量实验结果验证了我们方法的有效性,表明相较于 SOTA 方法有显著改进。
引用
@article{arxiv.2404.03144,
title = {Diverse and Tailored Image Generation for Zero-shot Multi-label Classification},
author = {Kaixin Zhang and Zhixiang Yuan and Tao Huang},
journal= {arXiv preprint arXiv:2404.03144},
year = {2024}
}