Fill-Up:用生成模型平衡长尾数据
计算机视觉与模式识别
2023-06-13 v1 机器学习
摘要
现代文本到图像合成模型已实现卓越的真实感,能从任意文本描述生成高质量图像。鉴于令人印象深刻的合成能力,若干研究在利用生成数据用于图像识别方面展示了有前景的结果。然而,用现有方法直接补充现实世界中数据饥渴的情形(例如少样本或长尾场景)仅带来边际性能提升,因为它们难以充分反映真实数据的分布。通过大量实验,本文提出一种用于长尾情形的新图像合成流水线,使用 Textual Inversion。研究表明,来自文本反演文本 token 的生成图像有效对齐真实域,显著增强了标准 ResNet50 主干的识别能力。我们还展示,通过用合成图像填补不平衡数据,可成功缓解现实世界数据不平衡场景。结合长尾识别领域的技术,我们的方法在从头训练时于标准长尾基准上取得最先进结果。
引用
@article{arxiv.2306.07200,
title = {Fill-Up: Balancing Long-Tailed Data with Generative Models},
author = {Joonghyuk Shin and Minguk Kang and Jaesik Park},
journal= {arXiv preprint arXiv:2306.07200},
year = {2023}
}
备注
32 pages, 19 Figures, and 10 Tables. Project webpage at https://alex4727.github.io/Fill-Up/