中文

LARP:基于学习型自回归生成先验的视频分词器

计算机视觉与模式识别 2025-06-18 v2 人工智能

摘要

我们提出 LARP,一种新颖的视频分词器,旨在克服当前用于自回归(AR)生成模型的视频分词方法的局限性。与直接将局部视觉块编码为离散令牌的传统逐块分词器不同,LARP 引入了一种整体分词方案,该方案使用一组学习到的整体查询从视觉内容中收集信息。这种设计使 LARP 能够捕获更全局和语义化的表示,而非局限于局部块级信息。此外,它通过支持任意数量的离散令牌提供了灵活性,从而能根据任务的具体需求实现自适应且高效的视频分词。为了将离散令牌空间与下游 AR 生成任务对齐,LARP 集成了一个轻量级 AR Transformer 作为训练时的先验模型,该模型在其离散潜在空间上预测下一个令牌。通过在训练期间引入先验模型,LARP 学习到的潜在空间不仅针对视频重建进行了优化,而且其结构方式更有利于自回归生成。此外,此过程为离散令牌定义了一个顺序,在训练期间逐步将其推向最优配置,从而确保在推理时实现更平滑、更准确的 AR 生成。综合实验证明了 LARP 的强大性能,在 UCF101 类别条件视频生成基准上达到了最先进的 FVD。LARP 增强了 AR 模型与视频的兼容性,并为构建统一的高保真多模态大语言模型(MLLM)开辟了潜力。

关键词

引用

@article{arxiv.2410.21264,
  title  = {LARP: Tokenizing Videos with a Learned Autoregressive Generative Prior},
  author = {Hanyu Wang and Saksham Suri and Yixuan Ren and Hao Chen and Abhinav Shrivastava},
  journal= {arXiv preprint arXiv:2410.21264},
  year   = {2025}
}

备注

ICLR 2025. Project page: https://hywang66.github.io/larp/