Storynizor:通过帧间同步与洗牌式ID注入实现一致的故事生成
计算机视觉与模式识别
2024-10-01 v1 人工智能
摘要
文本到图像扩散模型的最新进展激发了人们对连续故事图像生成的浓厚兴趣。在本文中,我们介绍了Storynizor,一个能够生成连贯故事、具有强帧间角色一致性、有效的前景-背景分离以及多样化姿态变化的模型。Storynizor的核心创新在于其关键模块:ID-Synchronizer和ID-Injector。ID-Synchronizer采用自动掩码自注意力模块和跨帧图像的掩码感知损失,以提高角色生成的连贯性,生动地表现其姿态和背景。ID-Injector利用洗牌参考策略(SRS)将ID特征整合到特定位置,增强基于ID的一致角色生成。此外,为促进Storynizor的训练,我们构建了一个名为StoryDB的新数据集,包含100,000张图像。该数据集包含不同环境、布局和姿态下的单角色和多角色集合,并附有详细描述。实验结果表明,与其他特定角色方法相比,Storynizor在连贯故事生成方面表现出色,具有高保真度的角色一致性、灵活的姿态和生动的背景。
关键词
引用
@article{arxiv.2409.19624,
title = {Storynizor: Consistent Story Generation via Inter-Frame Synchronized and Shuffled ID Injection},
author = {Yuhang Ma and Wenting Xu and Chaoyi Zhao and Keqiang Sun and Qinfeng Jin and Zeng Zhao and Changjie Fan and Zhipeng Hu},
journal= {arXiv preprint arXiv:2409.19624},
year = {2024}
}