一条轨迹,一个 Token:基于全景子对象轨迹的接地视频 Token 化
计算机视觉与模式识别
2026-05-12 v3 人工智能
图形学
机器学习
摘要
有效的视频 token 化对于扩展长视频 Transformer 模型至关重要。当前方法使用时空分块对视频进行 token 化,导致 token 数量过多且计算效率低下。最佳的 token 缩减策略在摄像机移动时会降低性能,且几乎无法减少 token 数量。我们引入了接地视频 token 化,这是一种基于全景子对象轨迹而非固定分块来组织 token 的范式。我们的方法与基本感知原理相一致,确保 token 化反映场景复杂度而非视频时长。我们提出了 TrajViT,一种视频编码器,它提取对象轨迹并将其转换为语义有意义的 token,在保持时间连贯性的同时显著降低冗余。通过对比学习训练,TrajViT 在多个视频理解基准上显著优于时空 ViT (ViT3D),例如,在视频文本检索任务中,TrajViT 在 10 倍 token 缩减下平均 top-5 召回率比 ViT3D 高出 6%。我们还表明,作为现代 VideoLLM 的视频编码器,TrajViT 是比 ViT3D 更强的模型,在 6 个 VideoQA 基准上平均获得 5.2% 的性能提升,同时训练时间快 4 倍,推理 FLOPs 少 18 倍。TrajViT 是首个在各种视频分析任务中始终优于 ViT3D 的高效编码器,使其成为一个稳健且可扩展的解决方案。
引用
@article{arxiv.2505.23617,
title = {One Trajectory, One Token: Grounded Video Tokenization via Panoptic Sub-object Trajectory},
author = {Chenhao Zheng and Jieyu Zhang and Mohammadreza Salehi and Ziqi Gao and Vishnu Iyengar and Norimasa Kobori and Quan Kong and Ranjay Krishna},
journal= {arXiv preprint arXiv:2505.23617},
year = {2026}
}
备注
ICCV 2025