中文

通过少样本 CLIP 辅助的扩散生成识别并缓解模型失效

计算机视觉与模式识别 2023-12-12 v1 机器学习

摘要

深度学习模型可能会遇到意外的失效,尤其是在处理具有挑战性的子群体时。这些失效的一个常见原因是物体出现在训练期间很少见到的背景中。为了更好地理解这些失效模式,人类可解释的描述对于进一步的分析和改进至关重要,但这通常成本高昂。在本研究中,我们提出了一个端到端框架,该框架利用大语言模型 (ChatGPT) 和视觉语言深度模型 (CLIP) 的能力,在无需人工干预的情况下生成与虚假关联(例如罕见的背景)相关的失效模式的文本描述。这些描述可用于使用生成模型(如扩散模型)生成合成数据。模型现在可以使用这些生成的数据从其弱点中学习,并提高其在每类数据不常见背景上的性能。我们的方法作为一种通用解决方案,有望在以少样本方式自动理解模型失效模式和强化深度学习模型在各种失效场景(例如背景、颜色)下的性能方面取得进展。我们的实验表明,在 4040 个不同的模型(如 ResNets、EfficientNets、DenseNets、Vision Transformer (ViT)、SwAVs、MoCos、DINOs 和 CLIPs)以及各种数据集(如 ImageNet-1000、CIFAR-10 和 CIFAR-100)上,针对困难子群体(特别是错误的背景关联)的准确率获得了约 \textbf{21%} 的显著提升。

关键词

引用

@article{arxiv.2312.05464,
  title  = {Identifying and Mitigating Model Failures through Few-shot CLIP-aided Diffusion Generation},
  author = {Atoosa Chegini and Soheil Feizi},
  journal= {arXiv preprint arXiv:2312.05464},
  year   = {2023}
}