利用引导式想象扩展小规模数据集
计算机视觉与模式识别
2023-10-11 v6 机器学习
摘要
深度神经网络(DNN)的能力严重依赖于训练数据的数量与质量。然而,大规模收集与标注数据通常昂贵且耗时。为解决此问题,我们探索了一项称为数据集扩展的新任务,旨在通过自动创建新标注样本来扩展一个即用型小规模数据集。为此,我们提出引导式想象框架(GIF),利用 DALL-E2 和 Stable Diffusion(SD)等前沿生成模型,从输入种子数据“想象”并创建信息丰富的新数据。具体而言,GIF 通过在先验模型的语义有意义空间中优化种子数据的潜在特征来进行数据想象,从而生成具有新内容的照片级真实图像。为引导想象朝向为模型训练创建信息丰富的样本,我们引入两个关键准则,即类保持信息增强与样本多样性提升。这些准则被验证对有效的数据集扩展至关重要:GIF-SD 在自然图像数据集上比无引导的 SD 扩展获得高 13.5% 的模型准确率。借助这些关键准则,GIF 在多种场景下成功扩展小规模数据集,在六个自然图像数据集上平均提升模型准确率 36.9%,在三个医学数据集上平均提升 13.5%。源代码见 https://github.com/Vanint/DatasetExpansion。
引用
@article{arxiv.2211.13976,
title = {Expanding Small-Scale Datasets with Guided Imagination},
author = {Yifan Zhang and Daquan Zhou and Bryan Hooi and Kai Wang and Jiashi Feng},
journal= {arXiv preprint arXiv:2211.13976},
year = {2023}
}
备注
NeurIPS 2023. Source code: https://github.com/Vanint/DatasetExpansion