中文

StoryWeaver: 知识增强的故事角色定制统一世界模型

计算机视觉与模式识别 2025-02-26 v3

摘要

故事可视化在人工智能领域已获得越来越多的关注。然而,现有方法在角色身份保持与文本语义对齐之间仍难以取得良好平衡,这主要是由于缺乏对故事场景的细粒度语义建模。为应对这一挑战,我们提出了一种新型知识图谱,即角色图(CG),全面表示与故事相关的各类知识,包括角色、与角色相关的属性以及角色之间的关系。随后我们引入 StoryWeaver,一个通过角色图实现定制(C-CG)的图像生成器,能够实现具有丰富文本语义的一致性故事可视化。为进一步提升多角色生成性能,我们将知识增强空间引导(KE-SG)融入 StoryWeaver,以精确地将角色语义注入生成过程。为验证所提方法的有效性,我们在名为 TBC-Bench 的新基准上进行了广泛实验。实验证实 StoryWeaver 不仅能够创建生动的视觉故事情节,还能在各种场景中准确传递角色身份,且具有相当的存储效率,例如 DINO-I 平均提升 +9.03%、CLIP-T 平均提升 +13.44%。此外,我们还进行了消融实验以验证所提模块的优越性。代码和数据集已发布于 https://github.com/Aria-Zhangjl/StoryWeaver。

关键词

引用

@article{arxiv.2412.07375,
  title  = {StoryWeaver: A Unified World Model for Knowledge-Enhanced Story Character Customization},
  author = {Jinlu Zhang and Jiji Tang and Rongsheng Zhang and Tangjie Lv and Xiaoshuai Sun},
  journal= {arXiv preprint arXiv:2412.07375},
  year   = {2025}
}