基于Sentence-BERT与FastGAN的印尼语文本到图像合成
计算机视觉与模式识别
2023-03-28 v1
摘要
当前,文本到图像合成采用文本编码器与图像生成器架构。该课题的研究具有挑战性。这是因为自然语言与视觉之间存在领域鸿沟。如今,该领域多数研究仅聚焦于生成照片级真实感图像,而另一域(此处指语言)则较少受关注。当前大量研究使用英语作为输入文本。此外,世界上存在许多语言。印尼语作为印度尼西亚的官方语言相当流行,已在菲律宾、澳大利亚和日本被教授。将数据集翻译或重建为另一种高质量语言代价高昂。该领域的研究十分必要,因为我们需要考察图像生成器在除生成照片级真实感图像外其他语言上的表现。为此,我们使用谷歌翻译并经由人工将 CUB 数据集译为印尼语。我们采用 Sentence BERT 作为文本编码器、FastGAN 作为图像生成器。FastGAN 使用大量跳跃激励模块和自编码器生成分辨率为 512x512x3 的图像,其尺寸为当前最先进模型(Zhang, Xu, Li, Zhang, Wang, Huang and Metaxas, 2019)的两倍。我们在 Inception Score 和 Fréchet inception distance 上分别取得 4.76 ± 0.43 和 46.401,与当前英语文本到图像生成模型相当。平均意见得分亦为 5 分中的 3.22,意味着生成图像可被人类接受。源代码链接:https://github.com/share424/Indonesian-Text-to-Image-synthesis-with-Sentence-BERT-and-FastGAN
引用
@article{arxiv.2303.14517,
title = {Indonesian Text-to-Image Synthesis with Sentence-BERT and FastGAN},
author = {Made Raharja Surya Mahadi and Nugraha Priya Utama},
journal= {arXiv preprint arXiv:2303.14517},
year = {2023}
}
备注
11 pages, 3 figures