中文

ReDiStory:基于区域解耦扩散的一致性视觉故事生成

计算机视觉与模式识别 2026-02-03 v1

摘要

生成连贯的视觉故事需要在保持主体身份的同时保留帧级语义。最近的无训练方法将身份提示和帧提示拼接成统一表示,但这常导致帧间语义干扰,削弱复杂故事中的身份保持。我们提出ReDiStory,一个无训练框架,通过推理时提示嵌入重组织来提高多帧故事生成效果。ReDiStory显式分解文本嵌入为身份相关和帧特定组件,然后通过抑制帧之间共享方向来解耦帧嵌入。这在不修改扩散参数或不需要额外监督的情况下减少了跨帧干扰。在相同的扩散 Backbone 和推理设置下,ReDiStory在保持提示忠实度的同时提高了身份一致性。在ConsiStory+基准上的实验表明,ReDiStory在多个身份一致性指标上均优于1Prompt1Story。代码已公开:https://github.com/YuZhenyuLindy/ReDiStory

关键词

引用

@article{arxiv.2602.01303,
  title  = {ReDiStory: Region-Disentangled Diffusion for Consistent Visual Story Generation},
  author = {Ayushman Sarkar and Zhenyu Yu and Chu Chen and Wei Tang and Kangning Cui and Mohd Yamani Idna Idris},
  journal= {arXiv preprint arXiv:2602.01303},
  year   = {2026}
}