中文

StoryImager: 一个用于连贯故事可视化与补全的统一高效框架

计算机视觉与模式识别 2024-04-10 v1

摘要

故事可视化旨在基于故事情节生成一系列真实且连贯的图像。当前模型通过将预训练的文本到图像模型转换为自回归方式,采用逐帧架构。尽管这些模型已展现出显著进展,但仍存在三个缺陷。1)自回归方式的单向生成限制了其在许多场景中的可用性。2)额外引入的故事历史编码器带来了极高的计算成本。3)故事可视化与续写模型的训练和推理是独立进行的,这对用户不够友好。为此,我们提出了一个双向、统一且高效的框架,即StoryImager。StoryImager增强了继承自预训练文本到图像模型的故事板生成能力,以实现双向生成。具体而言,我们引入了目标帧掩码策略,以扩展并统一不同的故事图像生成任务。此外,我们提出了帧-故事交叉注意力模块,将交叉注意力分解以实现局部保真度和全局连贯性。 moreover,我们设计了一个上下文特征提取器,以从整个故事情节中提取上下文信息。大量实验结果证明了我们的StoryImager的优异性能。代码可在 https://github.com/tobran/StoryImager 获取。

关键词

引用

@article{arxiv.2404.05979,
  title  = {StoryImager: A Unified and Efficient Framework for Coherent Story Visualization and Completion},
  author = {Ming Tao and Bing-Kun Bao and Hao Tang and Yaowei Wang and Changsheng Xu},
  journal= {arXiv preprint arXiv:2404.05979},
  year   = {2024}
}

备注

17 pages