中文

TokenTrim:自回归长视频生成的推理时长句子修剪

计算机视觉与模式识别 2026-02-03 v1 人工智能

摘要

自回归视频生成通过迭代条件生成每个新帧的批次来实现长视频合成。然而,近期研究表明,这类管道在长时间尺度上存在严重的时间漂移问题,即误差在时间上累积并放大。我们假设,这种漂移主要并非源于模型容量不足,而是来自推理时误差传播。具体而言,我们认为漂移源于在自回归推理期间对已损坏潜在条件标记的不可控重复使用。为纠正这种误差累积,我们提出一种简单的方法,在标记被重复用于条件之前识别并删除不稳定的潜在标记。为此,我们将不稳定标记定义为其表示与前一批次生成的标记显著偏离的潜在标记,表明可能存在损坏或语义漂移。通过显式删除自回归上下文中的损坏潜在标记,而非修改整个空间区域或模型参数,本方法可防止不可靠的潜在信息影响后续生成步骤。结果显著提升了在不修改模型架构、训练程序或潜在空间的前提下,长期时间尺度上的一致性。

关键词

引用

@article{arxiv.2602.00268,
  title  = {TokenTrim: Inference-Time Token Pruning for Autoregressive Long Video Generation},
  author = {Ariel Shaulov and Eitan Shaar and Amit Edenzon and Lior Wolf},
  journal= {arXiv preprint arXiv:2602.00268},
  year   = {2026}
}