DeCo-VAE:通过解耦表示学习视频重构的紧凑潜在特征
计算机视觉与模式识别
2025-11-19 v1 机器学习
多媒体
摘要
现有视频变分自编码器(VAE)通常忽视帧内容之间的相似性,导致潜在建模冗余。本文提出解耦VAE(DeCo-VAE)以实现紧凑潜在表示。不同于直接对RGB像素进行编码,本文通过显式解耦将视频内容分解为离散组件:关键帧、运动与残差,并为每个组件学习专用潜在表示。为避免跨组件干扰,本文为每个解耦组件设计专用编码器,采用共享3D解码器以维持重构期间的时空一致性。我们进一步利用解耦适应策略,在顺序训练中冻结部分编码器,确保稳定训练并准确学习静态与动态特征。广泛的定量与定性实验表明,DeCo-VAE在视频重构性能方面取得优异成果。
引用
@article{arxiv.2511.14530,
title = {DeCo-VAE: Learning Compact Latents for Video Reconstruction via Decoupled Representation},
author = {Xiangchen Yin and Jiahui Yuan and Zhangchi Hu and Wenzhang Sun and Jie Chen and Xiaozhen Qiao and Hao Li and Xiaoyan Sun},
journal= {arXiv preprint arXiv:2511.14530},
year = {2025}
}