中文

利用 LLaVA 生成的提示增强图像到图像生成

计算机视觉与模式识别 2024-11-13 v3

摘要

本文提出了一种利用大型语言与视觉助手 (LLaVA) 的多模态能力来增强图像到图像生成的新方法。我们提出了一个框架,其中 LLaVA 分析输入图像并生成文本描述,下文称为 LLaVA 生成的提示。这些提示与原始图像一起被输入到图像到图像生成流程中。这种丰富的表示引导生成过程产生与输入图像具有更强相似性的输出。大量实验证明了 LLaVA 生成的提示在促进图像相似性方面的有效性。我们观察到,与传统方法相比,生成图像与输入图像之间的视觉一致性有显著提升。未来的工作将探索微调 LLaVA 提示,以增加对创作过程的控制。通过在提示中提供更具体的细节,我们旨在生成输出中在原始图像的保真度与艺术表达之间实现微妙的平衡。

关键词

引用

@article{arxiv.2406.01956,
  title  = {Enhance Image-to-Image Generation with LLaVA-generated Prompts},
  author = {Zhicheng Ding and Panfeng Li and Qikai Yang and Siyang Li},
  journal= {arXiv preprint arXiv:2406.01956},
  year   = {2024}
}

备注

Accepted by 2024 5th International Conference on Information Science, Parallel and Distributed Systems