中文

DreamStory:由LLM引导的多主体一致扩散开域故事可视化

计算机视觉与模式识别 2025-08-13 v3 人工智能 多媒体

摘要

故事可视化旨在创建与文本叙述相对应的视觉吸引人的图像或视频。尽管近期扩散模型取得了令人期待的进展,现有方法仍在仅凭故事文本的情况下难以创建连贯且主体一致的帧序列。为此,我们提出DreamStory:一个利用LLM和新颖的多主体一致扩散模型构建的自动化开域故事可视化框架。DreamStory包含(1)充当故事导演的LLM,以及(2)用于生成跨图像中多主体一致性的创新型多主体一致扩散模型(MSD)。首先,DreamStory利用LLM为故事中每个场景的主体和场景生成描述性提示,为后续的主体一致生成标注每个场景的主体。其次,DreamStory利用这些详尽的主体描述创建主体肖像,这些肖像及其对应的文本信息作为多模态锚点(指导)。最后,MSD利用这些多模态锚点生成具有多主体一致性的故事场景。具体而言,MSD包括蒙版自注意力(MMSA)和蒙版互注意力(MMCA)模块。MMSA和MMCA模块分别确保参考图像和文本下的外观和语义一致性,两个模块均采用掩码机制以防止主体混合。为验证我们的方法并推动故事可视化领域的进展,我们建立了基准数据集DS-500,可评估故事可视化框架的整体性能、主体识别准确率以及生成模型的一致性。大量实验在主观和客观评估中均验证了DreamStory在故事可视化中的有效性。请访问我们的项目主页https://dream-xyz.github.io/dreamstory。

关键词

引用

@article{arxiv.2407.12899,
  title  = {DreamStory: Open-Domain Story Visualization by LLM-Guided Multi-Subject Consistent Diffusion},
  author = {Huiguo He and Huan Yang and Zixi Tuo and Yuan Zhou and Qiuyue Wang and Yuhang Zhang and Zeyu Liu and Wenhao Huang and Hongyang Chao and Jian Yin},
  journal= {arXiv preprint arXiv:2407.12899},
  year   = {2025}
}

备注

Accepted by TPAMI