中文

面向扩充小型训练图像数据集的人类引导图像生成

计算机视觉与模式识别 2024-12-25 v2 人工智能

摘要

计算机视觉模型在某些实际应用中(如稀有野生动物观察)的性能受限于可用图像数量的有限。使用预训练生成模型扩充数据集是有效的解决方案。然而,由于自动生成过程不可控,生成的图像通常在多样性上受限,且其中一些是不可接受的。本文提出一种用于更可控数据集扩充的人类引导图像生成方法。我们发展了一种具有理论保证的多模态投影方法,以促进原始图像和生成图像的探索。基于此探索,用户细化提示并重新生成图像以获得更佳效果。由于直接细化提示对新手用户而言具有挑战性,我们开发了一种样本级提示细化方法以简化操作。通过该方法,用户只需提供样本级反馈(例如,哪些样本是不可接受的),即可获得更好的提示。我们通过对多模态投影方法的定量评估、在分类和目标检测任务中的模型性能提升,以及来自专家的积极反馈,展示了该方法的有效性。

关键词

引用

@article{arxiv.2412.16839,
  title  = {Human-Guided Image Generation for Expanding Small-Scale Training Image Datasets},
  author = {Changjian Chen and Fei Lv and Yalong Guan and Pengcheng Wang and Shengjie Yu and Yifan Zhang and Zhuo Tang},
  journal= {arXiv preprint arXiv:2412.16839},
  year   = {2024}
}

备注

Accepted by TVCG2025