文本到图像跨模态生成:系统综述
计算机视觉与模式识别
2024-01-23 v1 计算与语言
机器学习
摘要
我们从“跨模态生成”的角度回顾了从文本生成视觉数据的研究。这一视角使我们能够比较各种针对输入文本并产生视觉输出的方法,而不将分析局限于狭窄的子领域。它还导致了该领域常见模板的识别,然后在相似方法池内以及跨研究路线之间进行比较和对比。我们将文本到图像生成细分为多种类型的图像生成方法、视频生成方法、图像编辑、自监督和基于图的方法。在讨论中,我们重点关注2016-2022年间在8个主要机器学习会议上发表的研究论文,同时也纳入了部分不符合所述搜索标准的相关论文。所进行的综述表明,该领域发表的论文数量显著增加,并指出了研究空白和潜在的研究方向。据我们所知,这是第一篇从“跨模态生成”角度系统审视文本到图像生成的综述。
引用
@article{arxiv.2401.11631,
title = {Text-to-Image Cross-Modal Generation: A Systematic Review},
author = {Maciej Żelaszczyk and Jacek Mańdziuk},
journal= {arXiv preprint arXiv:2401.11631},
year = {2024}
}