生成图文说明书
计算机视觉与模式识别
2024-04-16 v2 人工智能
机器学习
多媒体
摘要
我们引入了生成图文说明书这一新任务,即根据用户需求定制的视觉化说明。我们确定了该任务特有的需求,并通过一套自动和人工评估指标将其形式化,这些指标旨在衡量生成内容的有效性、一致性和功效。我们结合大型语言模型(LLMs)的强大能力与强大的文本到图像生成扩散模型,提出了一种名为 StackedDiffusion 的简单方法,该方法可根据输入的文本生成此类图文说明书。所得模型显著优于基线方法和最先进的多模态 LLMs;在 30% 的情况下,用户甚至更偏好它而非人工生成的文章。最值得注意的是,它实现了许多新颖且令人兴奋的应用,远超网页上静态文章所能提供的功能,例如根据用户的个人情况生成包含中间步骤和图片的个性化说明。
引用
@article{arxiv.2312.04552,
title = {Generating Illustrated Instructions},
author = {Sachit Menon and Ishan Misra and Rohit Girdhar},
journal= {arXiv preprint arXiv:2312.04552},
year = {2024}
}
备注
Accepted to CVPR 2024. Project website: http://facebookresearch.github.io/IllustratedInstructions. Code reproduction: https://github.com/sachit-menon/generating-illustrated-instructions-reproduction