重构视频生成的跨层表示:RepVideo
计算机视觉与模式识别
2025-01-16 v1
摘要
视频生成通过扩散模型取得了显著进展,显著提高了生成视频的质量。然而,最近的研究主要集中于扩大模型训练,却对表示对视频生成过程的直接影响提供了有限的见解。本文最初检验了中间层特征的特征,发现不同层之间的注意力图存在显著差异。这些差异导致语义表示不稳定, Contributing to features 之间的累积差异,最终降低相邻帧之间的相似性,进而影响时间一致性。为了解决此问题,我们提出了 RepVideo,一种用于文本到视频扩散模型的增强表示框架。通过累积来自相邻层的特征以形成丰富的表示,该方法捕获更稳定的语义信息。这些增强的表示被用作注意力机制的输入,从而在保持相邻帧特征一致性的同时提高了语义表达能力。广泛的实验表明,我们的 RepVideo 不仅显著增强了对准确空间外观的生成能力,例如捕获多个对象之间复杂的空间关系,还改善了视频生成中的时间一致性。
引用
@article{arxiv.2501.08994,
title = {RepVideo: Rethinking Cross-Layer Representation for Video Generation},
author = {Chenyang Si and Weichen Fan and Zhengyao Lv and Ziqi Huang and Yu Qiao and Ziwei Liu},
journal= {arXiv preprint arXiv:2501.08994},
year = {2025}
}
备注
Project page: https://vchitect.github.io/RepVid-Webpage