中文

多模态图像合成与编辑:生成式AI时代

计算机视觉与模式识别 2023-08-25 v6

摘要

由于真实世界中的信息以多种模态存在,多模态信息之间的有效交互与融合在计算机视觉与深度学习研究中对于多模态数据的创建与感知起着关键作用。凭借在建模多模态信息交互方面的卓越能力,多模态图像合成与编辑近年来成为热门研究方向。多模态引导为图像合成与编辑提供了直观且灵活的手段,而非为网络训练提供显式指导。另一方面,该领域也面临若干挑战,如多模态特征对齐、高分辨率图像合成、可靠的评估指标等。在本综述中,我们全面梳理近期多模态图像合成与编辑的进展,并根据数据模态与模型类型构建分类体系。我们首先介绍图像合成与编辑中不同的引导模态,随后依据模型类型广泛描述多模态图像合成与编辑方法。之后,我们描述基准数据集与评估指标以及相应实验结果。最后,我们提供关于当前研究挑战与未来可能方向的见解。与本综述相关的项目见 https://github.com/fnzhan/Generative-AI。

关键词

引用

@article{arxiv.2112.13592,
  title  = {Multimodal Image Synthesis and Editing: The Generative AI Era},
  author = {Fangneng Zhan and Yingchen Yu and Rongliang Wu and Jiahui Zhang and Shijian Lu and Lingjie Liu and Adam Kortylewski and Christian Theobalt and Eric Xing},
  journal= {arXiv preprint arXiv:2112.13592},
  year   = {2023}
}

备注

TPAMI 2023