TaleDiffusion:带对话渲染的多角色故事生成
计算机视觉与模式识别
2026-04-14 v2
摘要
文本到故事的可视化具有挑战性,因为需要在多帧之间保持多个角色的一致性交互。现有方法在角色一致性方面存在困难,导致生成伪影和对话渲染不准确,从而造成故事叙述脱节。为此,我们提出了一种新颖的框架 TaleDiffusion,通过迭代过程生成多角色故事,保持角色一致性,并通过后处理实现准确的对话分配。给定一个故事,我们利用预训练的 LLM 通过上下文学习生成逐帧描述、角色细节和对话,随后采用基于有界注意力的逐框掩码技术来控制角色交互并最小化伪影。然后,我们应用身份一致的自注意力机制以确保跨帧的角色一致性,并应用区域感知的交叉注意力以实现精确的物体放置。对话也被渲染为气泡,并通过 CLIPSeg 分配给相应角色。实验结果表明,TaleDiffusion 在一致性、降噪和对话渲染方面均优于现有方法。
引用
@article{arxiv.2509.04123,
title = {TaleDiffusion: Multi-Character Story Generation with Dialogue Rendering},
author = {Ayan Banerjee and Josep Llados and Umapada Pal and Anjan Dutta},
journal= {arXiv preprint arXiv:2509.04123},
year = {2026}
}