基于自适应上下文建模改进的视觉故事生成
计算机视觉与模式识别
2023-05-29 v1 计算与语言
摘要
构建于 Stable Diffusion 等强大文本到图像生成模型之上的扩散模型在视觉故事生成中取得了显著成功。然而,性能最佳的方法将历史生成结果视为扁平化的记忆单元,忽略了并非所有前文图像对当前阶段人物与场景生成的贡献均等这一事实。为此,我们提出了一种简单方法,通过自适应上下文建模改进领先系统;该建模不仅嵌入编码器中,还作为采样阶段的额外引导,以提升所生成故事的全局一致性。我们在 PororoSV 和 FlintstonesSV 数据集上评估了我们的模型,结果表明我们的方法在故事可视化与续写两种场景下均取得了最先进的 FID 分数。我们进行了详细的模型分析,并显示我们的模型擅长生成语义一致的故事图像。
引用
@article{arxiv.2305.16811,
title = {Improved Visual Story Generation with Adaptive Context Modeling},
author = {Zhangyin Feng and Yuchen Ren and Xinmiao Yu and Xiaocheng Feng and Duyu Tang and Shuming Shi and Bing Qin},
journal= {arXiv preprint arXiv:2305.16811},
year = {2023}
}