AutoStory:以最小人工成本生成多样化叙事图像
计算机视觉与模式识别
2023-11-21 v1
摘要
故事可视化旨在生成一系列与文本描述的故事相匹配的图像,并要求生成的图像满足高质量、与文本描述对齐以及角色身份一致性。鉴于故事可视化的复杂性,现有方法通过仅考虑少数特定角色和场景,或要求用户提供逐图控制条件(如草图)来极大地简化问题。然而,这些简化使这些方法无法胜任实际应用。为此,我们提出了一种自动化故事可视化系统,能够以最小的人机交互有效生成多样化、高质量且一致的故事图像集。具体而言,我们利用大语言模型的理解和规划能力进行布局规划,然后借助大规模文本到图像模型基于布局生成精细的故事图像。我们通过经验发现,稀疏控制条件(如边界框)适用于布局规划,而密集控制条件(如草图和关键点)适用于生成高质量图像内容。为兼得二者之长,我们设计了一个密集条件生成模块,将简单的边界框布局转换为草图或关键点控制条件用于最终图像生成,这不仅提升了图像质量,还实现了轻松直观的用户交互。此外,我们提出了一种简单而有效的方法生成多视图一致的角色图像,消除了依赖人工收集或绘制角色图像的需要。
引用
@article{arxiv.2311.11243,
title = {AutoStory: Generating Diverse Storytelling Images with Minimal Human Effort},
author = {Wen Wang and Canyu Zhao and Hao Chen and Zhekai Chen and Kecheng Zheng and Chunhua Shen},
journal= {arXiv preprint arXiv:2311.11243},
year = {2023}
}
备注
19 pages