RefTok:面向视频生成的基于参考的标记化
计算机视觉与模式识别
2025-07-04 v1
摘要
有效处理时间冗余仍然是学习视频模型的一个关键挑战。主流方法通常独立地处理每一组帧,未能有效捕捉视频中固有的时间依赖性和冗余性。为了解决这一局限性,我们引入了RefTok,一种新颖的基于参考的标记化方法,能够捕捉复杂的时间动态和上下文信息。我们的方法以未量化的参考帧为条件,对帧组进行编码和解码。在解码时,RefTok保留了跨帧的运动连续性和物体外观。例如,尽管有头部运动,RefTok仍能保留面部细节,正确重建文本,保留小图案,并从上下文中保持手写文字的可读性。在4个视频数据集(K600、UCF-101、BAIR Robot Pushing和DAVIS)上,RefTok显著优于当前最先进的标记器(Cosmos和MAGVIT),并在相同或更高压缩比下,将所有评估指标(PSNR、SSIM、LPIPS)平均提高了36.7%。当使用RefTok的潜在表示在BAIR Robot Pushing任务上训练视频生成模型时,生成的视频在所有生成指标上不仅优于MAGVIT-B,还优于参数多4倍的更大模型MAGVIT-L,平均提高了27.9%。
引用
@article{arxiv.2507.02862,
title = {RefTok: Reference-Based Tokenization for Video Generation},
author = {Xiang Fan and Xiaohang Sun and Kushan Thakkar and Zhu Liu and Vimal Bhat and Ranjay Krishna and Xiang Hao},
journal= {arXiv preprint arXiv:2507.02862},
year = {2025}
}