基于分层自适应 O.O.D 纠正的免费时长视频生成
计算机视觉与模式识别
2026-03-27 v1 人工智能
摘要
使用预训练视频扩散模型生成长视频(这些模型通常在短片段上训练)是一个显著挑战。直接将这些模型用于长视频推断会导致视觉质量显著下降。本文识别到这一问题主要源于两种序列外分布(O.O.D)问题:帧级相对位置 O.O.D 和上下文长度 O.O.D。为解决这些挑战,我们提出了 FreeLOC:一个无需训练、基于分层自适应的框架,引入两种核心技术:视频基相对位置重新编码(VRPR)用于帧级相对位置 O.O.D,这是一种多层次策略,以分层方式重新编码时间相对位置以与模型的预训练分布对齐;以及分层稀疏注意力(TSA)用于上下文长度 O.O.D,通过在不同时间尺度上结构化注意力密度来保留局部细节和长程依赖。关键的是,我们引入一种分层自适应探针机制,以识别每个转换器层对这些 O.O.D 问题的敏感性,从而实现对这些方法的选择性和高效应用。广泛的实验表明,我们的方法在时序一致性和视觉质量方面显著优于现有的无训练方法,实现了最先进的效果。代码可在 https://github.com/Westlake-AGI-Lab/FreeLOC 获取。
引用
@article{arxiv.2603.25209,
title = {Free-Lunch Long Video Generation via Layer-Adaptive O.O.D Correction},
author = {Jiahao Tian and Chenxi Song and Wei Cheng and Chi Zhang},
journal= {arXiv preprint arXiv:2603.25209},
year = {2026}
}
备注
Accepted to CVPR 2026. Code: https://github.com/Westlake-AGI-Lab/FreeLOC