Storybooth:无训练的多主体一致性视觉叙事
计算机视觉与模式识别
2025-04-09 v1 机器学习
多媒体
摘要
训练-free 一致的文本到图像生成, depicting 同一主体跨越不同图像,近年来备受广泛关注。现有工作主要依赖跨帧自注意力;这种方法通过允许每帧的 token 在自注意力计算中注意力分配到其他帧的 token,从而提高主体一致性。虽然对单一主体有用,但我们发现其在扩展到多个角色时存在挑战。本文首先分析这些限制的原因。我们的探索揭示,主要问题源于自注意力泄漏,这在试图确保多个角色一致性时被放大。当一个主体的 token 注意力分配到其他角色时,就会导致它们彼此相似(例如,狗看起来像鸭子)。基于这些发现,我们提出了 StoryBooth:一种用于提高多角色一致性的训练-free 方法。具体而言,我们首先利用多模态链式思考推理和区域生成,先验地在所需的叙事输出中局部化不同的主体。最终的输出则通过一个修改的扩散模型生成,该模型包含两个新层:1)受限跨帧自注意力层,用于减少主体间注意力泄漏,以及2)token 合并层,用于提高细粒度主体细节的一致性。通过定性和定量结果我们发现,所提方法优于先前的状态-of-the-art, 在多个角色和细粒度主体细节方面表现出更好的一致性。
关键词
引用
@article{arxiv.2504.05800,
title = {Storybooth: Training-free Multi-Subject Consistency for Improved Visual Storytelling},
author = {Jaskirat Singh and Junshen Kevin Chen and Jonas Kohler and Michael Cohen},
journal= {arXiv preprint arXiv:2504.05800},
year = {2025}
}