中文

一致的零样本视觉指令生成

计算机视觉与模式识别 2024-06-11 v2 人工智能

摘要

尽管文本到图像合成取得了进展,特别是针对扩散模型,但生成需要一致表征和对象在有序步骤中平滑状态转换的视觉指令仍然具有巨大挑战。本文引入一种简单且无需训练的框架来解决上述问题,充分利用了扩散模型和大语言模型(LLM)的进展。我们的方法系统性地整合文本理解和图像生成,以确保视觉指令在指令序列中保持视觉上吸引且一致准确。我们通过测试多步骤指令并与多个基线方法比较文本对齐和一致性来验证有效性。我们的实验表明,该方法能够生成连贯且视觉上令人愉悦的指令。

关键词

引用

@article{arxiv.2406.04337,
  title  = {Coherent Zero-Shot Visual Instruction Generation},
  author = {Quynh Phung and Songwei Ge and Jia-Bin Huang},
  journal= {arXiv preprint arXiv:2406.04337},
  year   = {2024}
}

备注

https://instruct-vis-zero.github.io/