中文

Make-A-Storyboard: 具有解耦与合并控制的故事板通用框架

计算机视觉与模式识别 2023-12-14 v1

摘要

故事可视化旨在生成与故事提示对齐的图像,通过角色与场景之间的视觉一致性来反映故事书的连贯性。然而,当前的方法仅关注角色而忽略了上下文相关场景之间的视觉一致性,导致生成的角色图像相互独立,缺乏图像间的连贯性。为了解决这个问题,受电影制作启发,我们提出了一种名为 Storyboard 的故事可视化新呈现形式,如图 1 所示。具体而言,Storyboard 将故事逐场景地展开为视觉表示。在 Storyboard 的每个场景中,角色在同一地点进行活动,因此需要视觉上一致的场景和角色。针对 Storyboard,我们设计了一个名为 Make-A-Storyboard 的通用框架,对上下文相关的角色和场景的一致性应用解耦控制,然后将它们合并以形成和谐的图像。大量实验证明了:1) 有效性。该方法在故事对齐、角色一致性和场景相关性方面的有效性;2) 泛化性。我们的方法可以无缝集成到主流的图像定制方法中,赋予它们故事可视化的能力。

关键词

引用

@article{arxiv.2312.07549,
  title  = {Make-A-Storyboard: A General Framework for Storyboard with Disentangled and Merged Control},
  author = {Sitong Su and Litao Guo and Lianli Gao and Heng Tao Shen and Jingkuan Song},
  journal= {arXiv preprint arXiv:2312.07549},
  year   = {2023}
}