Story2Board:基于自然语言的无训练表达式分镜生成
计算机视觉与模式识别
2025-08-14 v1 图形学
机器学习
摘要
我们提出Story2Board,一个无需训练的自然语言到表达式分镜生成框架。现有方法仅聚焦于主体身份,忽视了视觉叙事中的关键方面,如空间构图、背景演变和叙事节奏。为此,我们引入轻量级一致性框架,包含两个组件:潜在面板锚定(Latent Panel Anchoring),可在分镜之间保持共享角色参考;互惠注意力值混合(Reciprocal Attention Value Mixing),可软化具有强互惠注意力的标记对之间的视觉特征。通过这些机制,在无需架构修改或微调的情况下增强连贯性,使即将到来的扩散模型能够生成视觉上多样且一致的故事板。为结构化生成,我们使用即插即用的语言模型将自由形式的故事转换为基于面板的提示。为评估,我们提出Rich Storyboard基准——一套开放领域叙事,旨在评估布局多样性和基于背景的叙事,除连贯性外。我们还引入了新的场景多样性指标,用于量化故事板之间的空间和姿态变化。我们的定性和定量结果,以及用户研究显示,Story2Board生成的故事板在动态性、连贯性和叙事吸引力方面优于现有基线方法。
引用
@article{arxiv.2508.09983,
title = {Story2Board: A Training-Free Approach for Expressive Storyboard Generation},
author = {David Dinkevich and Matan Levy and Omri Avrahami and Dvir Samuel and Dani Lischinski},
journal= {arXiv preprint arXiv:2508.09983},
year = {2025}
}
备注
Project page is available at https://daviddinkevich.github.io/Story2Board/