DreamShot:基于视频扩散先验的个性化分镜合成
计算机视觉与模式识别
2026-04-21 v1
摘要
分镜合成在视觉叙事中发挥着关键作用,旨在生成能够以一致的角色、场景和过渡方式叙述电影事件的连贯镜头序列。然而,现有的做法大多来自文本到图像扩散模型,这些模型难以在多个镜头之间保持长期时间一致性、角色身份一致性和叙事流畅性。在本文中,我们引入DreamShot,一种基于视频生成模型的分镜框架,充分利用强大的视频扩散先验进行可控的多镜头合成。DreamShot支持文本到镜头和参考到镜头的生成,以及以前帧为条件的情节延续,实现灵活且情境感知的分镜合成。通过利用视频生成模型中固有的空间时间一致性,DreamShot能够生成在叙事忠实性和角色连续性方面具有更好表现的视觉和语义连贯序列。此外,DreamShot集成了多参考角色条件模块,该模块接受多个角色参考图像,并通过角色注意力一致性损失实现身份对齐,显式约束参考图像与生成角色之间的注意力。广泛的实验表明,DreamShot在场景连贯性、角色一致性和生成效率方面均优于当前最先进的文本到图像分镜模型,为基于可控视频模型驱动的视觉叙事开辟了新的方向。
引用
@article{arxiv.2604.17195,
title = {DreamShot: Personalized Storyboard Synthesis with Video Diffusion Prior},
author = {Junjia Huang and Binbin Yang and Pengxiang Yan and Jiyang Liu and Bin Xia and Zhao Wang and Yitong Wang and Liang Lin and Guanbin Li},
journal= {arXiv preprint arXiv:2604.17195},
year = {2026}
}
备注
Accepted by CVPR2026 as a Highlight paper