基于坐标的高效长视频分词方法
计算机视觉与模式识别
2025-04-04 v4 人工智能
机器学习
摘要
在能够处理长视频的视觉模型中,对视频进行高效分词仍是一个挑战。一个可行的方向是开发能够对长视频剪辑进行编码的分词器,因为这使得分词器能够更好地利用视频的时间一致性进行分词。然而,训练用于长视频的现有分词器往往会产生巨大的训练成本,因为它们被训练用于一次性重构所有帧。本文引入 CoordTok,一种从坐标表示到输入视频对应 patches 的映射学习器,受 3D 生成模型最新进展的启发。具体而言,CoordTok 将视频编码为因子化的三平面表示,并重构对应随机抽样 坐标的 patches。这使得可以在不要求昂贵训练资源的情况下,直接在长视频上训练大型分词器模型。我们的实验表明,CoordTok 能大幅降低对长视频剪辑进行编码所需的 token 数量。例如,CoordTok 可将分辨率为 的 128 帧视频编码为 1280 个 token,而基准方法则需要 6144 或 8192 个 token 才能实现类似的重构质量。我们进一步表明,这种高效视频分词使得能够一次性生成 128 帧的扩散变换器模型的训练在内存上更为高效。
引用
@article{arxiv.2411.14762,
title = {Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction},
author = {Huiwon Jang and Sihyun Yu and Jinwoo Shin and Pieter Abbeel and Younggyo Seo},
journal= {arXiv preprint arXiv:2411.14762},
year = {2025}
}
备注
Code is available on the project webpage: https://huiwon-jang.github.io/coordtok/