Lay2Story:基于布局可切换的分块Transformer故事生成
计算机视觉与模式识别
2025-08-13 v1
摘要
近期,涉及生成一致主体的故事叙述任务获得了广泛关注。然而,无论是训练自由还是训练型方法,都面临主体一致性不足的挑战,这源于缺乏细粒度引导和帧间交互。此外,该领域高质量数据的稀缺也使得难以精确控制故事叙述任务,包括主体的位置、外观、服装、表情和姿态,从而阻碍了领域的进一步发展。本文表明,布局条件(如主体位置和详细属性)有效促进了帧间的细粒度交互。这不仅加强了生成帧序列的一致性,也允许对主体的位置、外观及其他关键细节进行精确控制。基于此,我们引入了一种新型故事叙述任务:布局可切换故事叙述(Layout-Togglable Storytelling),通过纳入布局条件实现对主体的精确控制。为解决缺乏带布局注释的高质量数据集的问题,本文开发了Lay2Story-1M数据集,包含超过百万张720p及更高分辨率的图像,源自约1.13万小时的动画视频。基于Lay2Story-1M,我们创建了Lay2Story-Bench基准数据集,包含3000个提示,用于评估不同方法在该任务上的性能。此外,我们提出了Lay2Story框架,基于Diffusion Transformers(DiTs)架构,用于布局可切换故事叙述任务。通过定性和定量实验,我们发现该方法在一致性、语义关联性和审美质量方面均优于前沿技术(SOTA),取得了最佳成绩。
引用
@article{arxiv.2508.08949,
title = {Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation},
author = {Ao Ma and Jiasong Feng and Ke Cao and Jing Wang and Yun Wang and Quanwei Zhang and Zhanjie Zhang},
journal= {arXiv preprint arXiv:2508.08949},
year = {2025}
}
备注
Accepted by ICCV 2025