T2CI-GAN:基于生成对抗网络的文本到压缩图像生成
计算机视觉与模式识别
2022-10-11 v1 人工智能
机器学习
图像与视频处理
摘要
近年来,为视觉数据生成文本描述的问题已引起研究关注。相比之下,从文本描述生成视觉数据的问题仍然非常具有挑战性,因为这需要自然语言处理(NLP)与计算机视觉技术的结合。现有方法利用生成对抗网络(GANs)从文本描述生成未压缩图像。然而,在实际应用中,大多数视觉数据以压缩表示形式进行处理和传输。因此,本文提出的工作尝试使用深度卷积 GANs(DCGANs)直接以压缩表示形式生成视觉数据,以实现存储和计算效率。我们提出了从文本生成压缩图像的 GAN 模型。第一个模型直接使用 JPEG 压缩 DCT 图像(压缩域)进行训练,以从文本描述生成压缩图像。第二个模型使用 RGB 图像(像素域)进行训练,以从文本描述生成 JPEG 压缩 DCT 表示。所提模型在开源基准数据集 Oxford-102 Flower 图像上同时使用 RGB 和 JPEG 压缩版本进行了测试,并在 JPEG 压缩域取得了最先进的性能。代码将在论文录用后于 GitHub 公开发布。
引用
@article{arxiv.2210.03734,
title = {T2CI-GAN: Text to Compressed Image generation using Generative Adversarial Network},
author = {Bulla Rajesh and Nandakishore Dusa and Mohammed Javed and Shiv Ram Dubey and P. Nagabhushan},
journal= {arXiv preprint arXiv:2210.03734},
year = {2022}
}
备注
Accepted for publication at IAPR's 6th CVIP 2022