DeRA:用于视频分词的数据解耦表示对齐
计算机视觉与模式识别
2025-12-05 v1
摘要
本文提出 DeRA,一种新的 1D 视频词典化器,通过解耦视频词典化中的空间时空表示学习,以实现更好的训练效率和性能。具体而言,DeRA 在保持紧凑 1D 隐空间的同时,将视频编码因子化为外观流和运动流,这两个流分别与预训练的视觉基础模型对齐,以分别捕捉视频中的空间语义和时序动态。为解决异构监督引入的梯度冲突,我们进一步提出对称对齐冲突投影(SACP)模块,主动通过抑制沿冲突方向的分量来重新构建梯度。大量实验表明,DeRA 在 UCF-101 数据集上相较于 LARP(领先的视频词典化器)提高了 25% 的 rFVD。此外,使用 DeRA 进行自回归视频生成,我们也在 UCF-101 类别条件生成和 K600 帧预测方面取得了新的最佳结果。
引用
@article{arxiv.2512.04483,
title = {DeRA: Decoupled Representation Alignment for Video Tokenization},
author = {Pengbo Guo and Junke Wang and Zhen Xing and Chengxu Liu and Daoguo Dong and Xueming Qian and Zuxuan Wu},
journal= {arXiv preprint arXiv:2512.04483},
year = {2025}
}