中文

利用基于扩散的自动增强多样化你的视觉数据集

计算机视觉与模式识别 2023-10-31 v2 人工智能

摘要

许多细粒度分类任务,如稀有动物识别,训练数据有限,因此在这些数据集上训练的分类器往往无法泛化到域内的变化(如天气或位置改变)。为此,我们探索如何将训练数据中可见域的自然语言描述,与在多样化预训练数据集上训练的大型视觉模型结合,以生成有用的训练数据变体。我们提出 ALIA(Automated Language-guided Image Augmentation,自动语言引导图像增强),一种利用大型视觉与语言模型自动生成数据集域的自然语言描述并通过语言引导图像编辑增强训练数据的方法。为保持数据完整性,一个在原始数据集上训练的模型会过滤掉微小图像编辑及那些破坏类别相关信息的情况。所得数据集在视觉上与原始训练数据一致,并提供了显著增强的多样性。我们表明,在细粒度分类任务(包括域泛化与上下文偏置情形)上,ALIA 能够超越传统数据增强与文本到图像生成的数据。代码见 https://github.com/lisadunlap/ALIA。

关键词

引用

@article{arxiv.2305.16289,
  title  = {Diversify Your Vision Datasets with Automatic Diffusion-Based Augmentation},
  author = {Lisa Dunlap and Alyssa Umino and Han Zhang and Jiezhi Yang and Joseph E. Gonzalez and Trevor Darrell},
  journal= {arXiv preprint arXiv:2305.16289},
  year   = {2023}
}

备注

Update: replaced Planes dataset with Waterbirds & updated results after bug fix