中文

Storybooth:无训练的多主体一致性视觉叙事

计算机视觉与模式识别 2025-04-09 v1 机器学习 多媒体

摘要

训练-free 一致的文本到图像生成, depicting 同一主体跨越不同图像,近年来备受广泛关注。现有工作主要依赖跨帧自注意力;这种方法通过允许每帧的 token 在自注意力计算中注意力分配到其他帧的 token,从而提高主体一致性。虽然对单一主体有用,但我们发现其在扩展到多个角色时存在挑战。本文首先分析这些限制的原因。我们的探索揭示,主要问题源于自注意力泄漏,这在试图确保多个角色一致性时被放大。当一个主体的 token 注意力分配到其他角色时,就会导致它们彼此相似(例如,狗看起来像鸭子)。基于这些发现,我们提出了 StoryBooth:一种用于提高多角色一致性的训练-free 方法。具体而言,我们首先利用多模态链式思考推理和区域生成,先验地在所需的叙事输出中局部化不同的主体。最终的输出则通过一个修改的扩散模型生成,该模型包含两个新层:1)受限跨帧自注意力层,用于减少主体间注意力泄漏,以及2)token 合并层,用于提高细粒度主体细节的一致性。通过定性和定量结果我们发现,所提方法优于先前的状态-of-the-art, 在多个角色和细粒度主体细节方面表现出更好的一致性。

关键词

引用

@article{arxiv.2504.05800,
  title  = {Storybooth: Training-free Multi-Subject Consistency for Improved Visual Storytelling},
  author = {Jaskirat Singh and Junshen Kevin Chen and Jonas Kohler and Michael Cohen},
  journal= {arXiv preprint arXiv:2504.05800},
  year   = {2025}
}