来自视频的自回归预训练的实证研究
计算机视觉与模式识别
2025-01-10 v1 人工智能
摘要
我们实证研究了来自视频的自回归预训练。为了进行我们的研究,我们构建了一系列自回归视频模型,称为Toto。我们将视频视为视觉标记序列,并训练Transformer模型来自回归预测未来的标记。我们的模型在包含超过1万亿个视觉标记的多样化视频和图像数据集上进行了预训练。我们探索了不同的架构、训练和推理设计选择。我们在包括图像识别、视频分类、目标跟踪和机器人技术在内的一系列下游任务上评估了学习到的视觉表示。我们的结果表明,尽管归纳偏置极小,自回归预训练在所有基准测试中都取得了有竞争力的性能。最后,我们发现扩展我们的视频模型会产生与语言模型类似的缩放曲线,尽管速率不同。更多详情请访问https://brjathu.github.io/toto/。
引用
@article{arxiv.2501.05453,
title = {An Empirical Study of Autoregressive Pre-training from Videos},
author = {Jathushan Rajasegaran and Ilija Radosavovic and Rahul Ravishankar and Yossi Gandelsman and Christoph Feichtenhofer and Jitendra Malik},
journal= {arXiv preprint arXiv:2501.05453},
year = {2025}
}