TaleCrafter:支持多角色的交互式故事可视化系统
计算机视觉与模式识别
2023-05-31 v2
摘要
准确的故事可视化需要若干必要元素,例如跨帧的身份一致性、纯文本与视觉内容之间的对齐,以及图像中物体的合理布局。大多数先前工作致力于通过在具有相同风格和相同角色的一组视频(如 FlintstonesSV 数据集)上拟合文本到图像(T2I)模型来满足这些要求。然而,习得的 T2I 模型通常难以适应新角色、场景和风格,且往往缺乏修订合成图像布局的灵活性。本文提出一种通用的交互式故事可视化系统,能够处理多个新颖角色并支持布局与局部结构的编辑。该系统通过利用在大规模语料上训练的大语言与 T2I 模型的先验知识而开发。系统由四个相互关联的组件构成:故事到提示生成(S2P)、文本到布局生成(T2L)、可控文本到图像生成(C-T2I)以及图像到视频动画(I2V)。首先,S2P 模块将简洁的故事信息转换为后续阶段所需的详细提示。接着,T2L 基于提示生成多样且合理的布局,为用户提供按偏好调整和优化布局的能力。核心组件 C-T2I 支持在布局、草图和角色特定标识符引导下创建图像,以在可视化中保持一致性及细节。最后,I2V 通过对生成图像进行动画化来丰富可视化过程。我们进行了大量实验与一项用户研究,以验证所提系统的有效性与交互编辑的灵活性。
引用
@article{arxiv.2305.18247,
title = {TaleCrafter: Interactive Story Visualization with Multiple Characters},
author = {Yuan Gong and Youxin Pang and Xiaodong Cun and Menghan Xia and Yingqing He and Haoxin Chen and Longyue Wang and Yong Zhang and Xintao Wang and Ying Shan and Yujiu Yang},
journal= {arXiv preprint arXiv:2305.18247},
year = {2023}
}
备注
Github repository: https://github.com/VideoCrafter/TaleCrafter