DLFR-VAE:用于视频生成的动态潜在帧率变分自编码器
计算机视觉与模式识别
2025-04-03 v2 人工智能
摘要
本文提出了动态潜在帧率变分自编码器(DLFR-VAE),这是一种无需训练即可利用潜在空间中自适应时间压缩的训练范式。虽然现有的视频生成模型通过预训练的VAE应用固定压缩率,但我们观察到实际视频内容在时间上呈现显著的非均匀性,其中高运动片段包含的背景信息远多于静态场景。基于这一洞察,DLFR-VAE根据内容复杂度动态调整潜在帧率。具体而言,DLFR-VAE包含两个核心创新:(1)一种动态潜在帧率调度器,将视频划分为时间块,并根据信息论内容复杂度自适应确定最优帧率;(2)一种无需训练的适应机制,将预训练的VAE架构转换为能够处理可变帧率特征的动态VAE。我们的简单而有效的DLFR-VAE可以作为即插即用模块,无缝集成到现有的视频生成模型中,从而加速视频生成过程。
引用
@article{arxiv.2502.11897,
title = {DLFR-VAE: Dynamic Latent Frame Rate VAE for Video Generation},
author = {Zhihang Yuan and Siyuan Wang and Rui Xie and Hanling Zhang and Tongcheng Fang and Yuzhang Shang and Shengen Yan and Guohao Dai and Yu Wang},
journal= {arXiv preprint arXiv:2502.11897},
year = {2025}
}