ReCap:面向连贯故事可视化的轻量级指代 grounding
计算机视觉与模式识别
2026-04-21 v1
摘要
故事可视化旨在生成一系列图像,忠实地描绘文本叙事,同时保持人物身份、空间配置和随叙事推进而变化的风格一致性。传统上,维持此类跨帧一致性依赖显式记忆库、架构扩张或辅助语言模型,导致参数大幾增加和推理开销。我们引入 ReCap,一个轻量级一致性框架,在不修改基础扩散主干网络的情况下提升人物稳定性和视觉保真度。ReCap 的 CORE(COnditional frame REferencing)模块将指代词(本文中为代词)视为视觉锚点,仅在人物被指代时激活,并基于前一帧进行条件化,以传递视觉身份。这种选择性设计避免了无条件的跨帧条件化,仅引入 149K 的额外参数,远低于记忆库和 LLM 增强方法的成本。为进一步稳定身份,我们在训练期间仅采用 SemDrift(引导语义漂移校正)来校正身份。当文本模糊或指代时,denoiser 缺乏身份定义属性的视觉锚点,导致人物在帧之间出现外观漂移,SemDrift 通过将 denoiser 表征与预训练的 DINOv3 视觉嵌入对齐来实现校正,在零推理成本下强制执行语义身份稳定性。ReCap 在两个主要故事可视化基准测试上超越了 StoryGPT-V,以 FlintstonesSV 上的 2.63% 人物准确率和 PororoSV 上的 5.65% 提升,建立了两个基准测试的人物一致性新纪录。此外,我们将故事可视化扩展到源自真实电影的人类中心叙事,展示了 ReCap 超越卡通化风格域的能力。
关键词
引用
@article{arxiv.2604.18575,
title = {ReCap: Lightweight Referential Grounding for Coherent Story Visualization},
author = {Aditya Arora and Akshita Gupta and Pau Rodriguez and Marcus Rohrbach},
journal= {arXiv preprint arXiv:2604.18575},
year = {2026}
}
备注
Diffusion Models, Story Visualization