自适应1D视频扩散自动编码器
计算机视觉与模式识别
2026-02-05 v1
摘要
最新的视频生成模型大多依赖将像素空间视频压缩到潜在表示的视频自动编码器。然而,现有的视频自动编码器存在三个主要局限性:(1)固定速率压缩在简单视频上浪费token;(2)不可变的CNN架构阻碍可变长度潜在建模;(3)确定性解码器难以从压缩后的潜在表示中恢复适当细节。为此,我们提出了一种称为One-Dimensional Diffusion Video Autoencoder (One-DVA) 的 transformer-based 框架,用于自适应1D编码和扩散解码。编码器采用基于查询的视觉 transformer 提取时空特征并生成潜在表示,同时通过可变长度 dropout 机制动态调整潜在长度。解码器是一个以潜在表示为输入条件的像素空间扩散 transformer,用于重构视频。通过两阶段训练策略,One-DVA在相同的压缩比率下实现了与3D-CNN VAE相当的重构指标性能。更重要的是,它支持自适应压缩,从而可以实现更高的压缩比率。为更好地支持下游潜在生成,我们进一步对One-DVA的潜在分布进行正则化,以支持生成式建模,并微调其解码器以缓解由生成过程引起的artifacts。
关键词
引用
@article{arxiv.2602.04220,
title = {Adaptive 1D Video Diffusion Autoencoder},
author = {Yao Teng and Minxuan Lin and Xian Liu and Shuai Wang and Xiao Yang and Xihui Liu},
journal= {arXiv preprint arXiv:2602.04220},
year = {2026}
}