面向文本到图像合成的语义感知数据增强
计算机视觉与模式识别
2023-12-14 v1
摘要
数据增强最近被用作各种视觉-语言深度神经网络中的有效正则化器。然而,在文本到图像合成(T2Isyn)中,当前的增强智慧仍然遭受增强配对数据之间的语义不匹配。更糟糕的是,当生成的图像在语义上约束较少时,可能会发生语义崩溃。在本文中,我们开发了一个专用于T2Isyn的新颖的语义感知数据增强(SADA)框架。特别是,我们提出通过隐式文本语义保留增强()在语义空间中增强文本,并结合专门设计的图像语义正则化损失()作为生成图像语义守恒,以很好地应对语义不匹配和坍塌。作为一个主要贡献,我们从理论上证明,可以保证更好的文本-图像一致性,而正则化生成图像的语义将避免语义坍塌并提高图像质量。大量实验验证了SADA在各种骨干网络的T2Isyn模型中显著增强了文本-图像一致性并提高了图像质量。特别是,在Stable Diffusion模型的调优过程中加入SADA也带来了性能提升。
引用
@article{arxiv.2312.07951,
title = {Semantic-aware Data Augmentation for Text-to-image Synthesis},
author = {Zhaorui Tan and Xi Yang and Kaizhu Huang},
journal= {arXiv preprint arXiv:2312.07951},
year = {2023}
}
备注
Accepted by AAAI24