中文

单日单机训练大型视频模型

计算机视觉与模式识别 2023-09-29 v1

摘要

视频数据庞大、预处理复杂且训练缓慢。最先进的大规模视频模型在 32 块或更多 GPU 的集群上训练数天。因此,学术界在很大程度上将大型视频模型的训练让位于工业界。在本文中,我们展示如何仍能在配备八块消费级 GPU 的单台机器上于一天内训练出最先进的视频模型。我们识别出三个瓶颈——IO、CPU 和 GPU 计算,并对每一项进行优化。结果是一个高效的视频训练流水线。在架构可比的情况下,我们的流水线以先前工作 18\frac{1}{8} 的计算量取得了更高的准确率。代码见 https://github.com/zhaoyue-zephyrus/AVION。

关键词

引用

@article{arxiv.2309.16669,
  title  = {Training a Large Video Model on a Single Machine in a Day},
  author = {Yue Zhao and Philipp Krähenbühl},
  journal= {arXiv preprint arXiv:2309.16669},
  year   = {2023}
}

备注

Tech report. Code is available at https://github.com/zhaoyue-zephyrus/AVION