TTIDA:基于文本到文本与文本到图像模型的可控生成式数据增强
计算机视觉与模式识别
2023-04-19 v1 计算与语言
机器学习
摘要
数据增强已被确立为补充低资源数据集有用信息的有效途径。传统的增强技术如噪声注入与图像变换已被广泛使用。此外,生成式数据增强(GDA)已被证明能产生更多样且灵活的数据。虽然生成对抗网络(GANs)常用于GDA,但相较于文本到图像扩散模型,其缺乏多样性与可控性。本文中,我们提出TTIDA(Text-to-Text-to-Image Data Augmentation,文本到文本到图像数据增强),以利用大规模预训练文本到文本(T2T)与文本到图像(T2I)生成模型的能力进行数据增强。通过以T2T模型生成的详细描述为条件约束T2I模型,我们能够以灵活可控的方式生成照片级真实感的带标签图像。在域内分类、跨域分类和图像描述任务上的实验显示出相对于其他数据增强基线的一致提升。在少样本、长尾和对抗等多种设置下的分析研究进一步巩固了TTIDA在提升性能与增强鲁棒性方面的有效性。
引用
@article{arxiv.2304.08821,
title = {TTIDA: Controllable Generative Data Augmentation via Text-to-Text and Text-to-Image Models},
author = {Yuwei Yin and Jean Kaddour and Xiang Zhang and Yixin Nie and Zhenguang Liu and Lingpeng Kong and Qi Liu},
journal= {arXiv preprint arXiv:2304.08821},
year = {2023}
}