中文

图像生成与图像描述生成——可逆方法

计算机视觉与模式识别 2024-10-29 v1

摘要

本工作旨在构建一个能够同时完成图像描述和图像生成的模型,仅需在一个任务上进行训练。核心思想是训练一个可逆模型,学习图像和文本嵌入之间的一一映射。一旦在图像描述任务上高效训练了该可逆模型,该模型即可通过反向过程为给定文本生成新图像,无需额外训练。本文提出了一种简单的可逆神经网络架构用于解决此问题,并呈现了我们的当前发现。

关键词

引用

@article{arxiv.2410.20171,
  title  = {Image Generation from Image Captioning -- Invertible Approach},
  author = {Nandakishore S Menon and Chandramouli Kamanchi and Raghuram Bharadwaj Diddigi},
  journal= {arXiv preprint arXiv:2410.20171},
  year   = {2024}
}

备注

Accepted as Tiny Paper at ICVGIP 2024 conference