图像生成与图像描述生成——可逆方法
计算机视觉与模式识别
2024-10-29 v1
摘要
本工作旨在构建一个能够同时完成图像描述和图像生成的模型,仅需在一个任务上进行训练。核心思想是训练一个可逆模型,学习图像和文本嵌入之间的一一映射。一旦在图像描述任务上高效训练了该可逆模型,该模型即可通过反向过程为给定文本生成新图像,无需额外训练。本文提出了一种简单的可逆神经网络架构用于解决此问题,并呈现了我们的当前发现。
引用
@article{arxiv.2410.20171,
title = {Image Generation from Image Captioning -- Invertible Approach},
author = {Nandakishore S Menon and Chandramouli Kamanchi and Raghuram Bharadwaj Diddigi},
journal= {arXiv preprint arXiv:2410.20171},
year = {2024}
}
备注
Accepted as Tiny Paper at ICVGIP 2024 conference