中文

RefTok:面向视频生成的基于参考的标记化

计算机视觉与模式识别 2025-07-04 v1

摘要

有效处理时间冗余仍然是学习视频模型的一个关键挑战。主流方法通常独立地处理每一组帧,未能有效捕捉视频中固有的时间依赖性和冗余性。为了解决这一局限性,我们引入了RefTok,一种新颖的基于参考的标记化方法,能够捕捉复杂的时间动态和上下文信息。我们的方法以未量化的参考帧为条件,对帧组进行编码和解码。在解码时,RefTok保留了跨帧的运动连续性和物体外观。例如,尽管有头部运动,RefTok仍能保留面部细节,正确重建文本,保留小图案,并从上下文中保持手写文字的可读性。在4个视频数据集(K600、UCF-101、BAIR Robot Pushing和DAVIS)上,RefTok显著优于当前最先进的标记器(Cosmos和MAGVIT),并在相同或更高压缩比下,将所有评估指标(PSNR、SSIM、LPIPS)平均提高了36.7%。当使用RefTok的潜在表示在BAIR Robot Pushing任务上训练视频生成模型时,生成的视频在所有生成指标上不仅优于MAGVIT-B,还优于参数多4倍的更大模型MAGVIT-L,平均提高了27.9%。

关键词

引用

@article{arxiv.2507.02862,
  title  = {RefTok: Reference-Based Tokenization for Video Generation},
  author = {Xiang Fan and Xiaohang Sun and Kushan Thakkar and Zhu Liu and Vimal Bhat and Ranjay Krishna and Xiang Hao},
  journal= {arXiv preprint arXiv:2507.02862},
  year   = {2025}
}