基于富上下文条件扩散模型提升故事可视化一致性
计算机视觉与模式识别
2024-07-08 v2
摘要
最近的研究表明,条件扩散模型在生成一致故事方面具有巨大的潜力。然而,当前方法主要以自回归方式生成故事,且过于依赖标题,往往低估了生成过程中帧的上下文一致性和相关性。为此,我们提出一种新型富上下文条件扩散模型(RCDMs),这是一种两阶段方法,旨在增强故事生成的语义一致性和时间一致性。具体而言,在第一阶段,提出了帧-先验转换器扩散模型,通过对齐已知片段中标题与帧之间的语义关联,来预测未知片段的帧语义嵌入。第二阶段则引入丰富的上下文条件,包括已知片段的参考图像、未知片段的预测帧语义嵌入以及所有标题的文本嵌入。通过在图像和特征水平上联合注入这些丰富的上下文条件,RCDMs能够生成语义和时间一致性强的故事。此外,RCDMs仅需一次前向推理即可生成一致故事,优于自回归模型。我们的定性和定量结果表明,我们提出的RCDMs在具有挑战性的场景中性能优异。代码和模型将在 https://github.com/muzishen/RCDMs 发布。
引用
@article{arxiv.2407.02482,
title = {Boosting Consistency in Story Visualization with Rich-Contextual Conditional Diffusion Models},
author = {Fei Shen and Hu Ye and Sibo Liu and Jun Zhang and Cong Wang and Xiao Han and Wei Yang},
journal= {arXiv preprint arXiv:2407.02482},
year = {2024}
}