中文

学习自适应和时序因果视频分词于1D潜空间

计算机视觉与模式识别 2025-10-15 v2

摘要

我们提出AdapTok,这是一种自适应时序因果视频分词器,可根据视频内容灵活分配不同帧的token。AdapTok配备了块级遮蔽策略,在训练期间随机丢弃每个块的尾部token,以及块级因果评分器,用于预测使用不同数量token时视频帧的重建质量。在推理阶段,进一步提出基于整数线性规划的自适应token分配策略,以调整给定预测得分后的token使用情况。这种设计允许在可控总体预算下进行样本级、内容感知和时序动态的token分配。对UCF-101和Kinetics-600上的视频重建和生成进行大量实验,证明了我们方法的有效性。在不额外使用图像数据的情况下,AdapTok在不同token预算下一致性地改进了重建质量和生成性能,实现了更可扩展和更高效的生成式视频建模。

关键词

引用

@article{arxiv.2505.17011,
  title  = {Learning Adaptive and Temporally Causal Video Tokenization in a 1D Latent Space},
  author = {Yan Li and Changyao Tian and Renqiu Xia and Ning Liao and Weiwei Guo and Junchi Yan and Hongsheng Li and Jifeng Dai and Hao Li and Xue Yang},
  journal= {arXiv preprint arXiv:2505.17011},
  year   = {2025}
}

备注

Code: https://github.com/VisionXLab/AdapTok