ReDiStory:基于区域解耦扩散的一致性视觉故事生成
计算机视觉与模式识别
2026-02-03 v1
摘要
生成连贯的视觉故事需要在保持主体身份的同时保留帧级语义。最近的无训练方法将身份提示和帧提示拼接成统一表示,但这常导致帧间语义干扰,削弱复杂故事中的身份保持。我们提出ReDiStory,一个无训练框架,通过推理时提示嵌入重组织来提高多帧故事生成效果。ReDiStory显式分解文本嵌入为身份相关和帧特定组件,然后通过抑制帧之间共享方向来解耦帧嵌入。这在不修改扩散参数或不需要额外监督的情况下减少了跨帧干扰。在相同的扩散 Backbone 和推理设置下,ReDiStory在保持提示忠实度的同时提高了身份一致性。在ConsiStory+基准上的实验表明,ReDiStory在多个身份一致性指标上均优于1Prompt1Story。代码已公开:https://github.com/YuZhenyuLindy/ReDiStory
引用
@article{arxiv.2602.01303,
title = {ReDiStory: Region-Disentangled Diffusion for Consistent Visual Story Generation},
author = {Ayushman Sarkar and Zhenyu Yu and Chu Chen and Wei Tang and Kangning Cui and Mohd Yamani Idna Idris},
journal= {arXiv preprint arXiv:2602.01303},
year = {2026}
}