StoryMem:基于记忆的多镜头长视频叙事
计算机视觉与模式识别
2025-12-23 v1
摘要
视觉叙事需要生成带有电影质量且长期一致性的多镜头视频。鼓励人类记忆,我们提出StoryMem范式,将长篇视频叙事重新表述为以显式视觉记忆为条件的迭代镜头合成,将预训练的单镜头视频扩散模型转化为多镜头叙事者。这通过一种新颖的Memory-to-Video(M2V)设计实现,该设计维护来自历史生成镜头的紧凑且动态更新的记忆库。存储的记忆通过潜在拼接和负Rope位移注入单镜头视频扩散模型中,仅需LoRA微调。结合语义关键帧选择策略和审美偏好过滤,进一步确保记忆在生成过程中的信息性和稳定性。此外,该框架天然支持顺畅的镜头转换和定制化的故事生成应用。为促进评估,我们引入了ST-Bench——用于多镜头视频叙事的多样化基准。大量实验表明,StoryMem在保持高审美质量和提示遵循性方面,显著优于先前方法,实现了跨镜头的卓越一致性,标志着向连贯分钟级视频叙事迈出的重要一步。
引用
@article{arxiv.2512.19539,
title = {StoryMem: Multi-shot Long Video Storytelling with Memory},
author = {Kaiwen Zhang and Liming Jiang and Angtian Wang and Jacob Zhiyuan Fang and Tiancheng Zhi and Qing Yan and Hao Kang and Xin Lu and Xingang Pan},
journal= {arXiv preprint arXiv:2512.19539},
year = {2025}
}
备注
Project page: https://kevin-thu.github.io/StoryMem