中文

面向视频扩散 Transformer:精确标度定律

计算机视觉与模式识别 2025-01-03 v2 人工智能 机器学习

摘要

在给定数据和计算预算的情况下,实现视频扩散 Transformer 的最佳性能至关重要,因为其训练成本极高。这需要在大规模训练前精确确定最佳模型规模和训练超参数。虽然标度定律在语言模型中用于预测性能,但其在视觉生成模型中的存在性和准确推导仍未得到充分探讨。本文系统地分析了视频扩散 Transformer 的标度定律并确认了其存在性。此外,我们发现与语言模型不同,视频扩散模型对学习率和批量大小更为敏感,这两种超参数往往未被精确建模。为此,我们提出了一种新的标度定律,用于预测任意模型规模和计算预算下的最佳超参数。在这些最佳设置下,在计算预算为 1e10 TFlops 的情况下,我们实现的性能与常规标度方法相当,同时将推理成本降低了 40.1%。此外,我们建立了验证损失、任意模型规模和计算预算之间更普遍且精确的关系。这使我们能够预测非最佳模型规模下的性能,这在实际推理成本受限时也可能受到青睐,从而实现更好的权衡。

关键词

引用

@article{arxiv.2411.17470,
  title  = {Towards Precise Scaling Laws for Video Diffusion Transformers},
  author = {Yuanyang Yin and Yaqi Zhao and Mingwu Zheng and Ke Lin and Jiarong Ou and Rui Chen and Victor Shea-Jay Huang and Jiahao Wang and Xin Tao and Pengfei Wan and Di Zhang and Baoqun Yin and Wentao Zhang and Kun Gai},
  journal= {arXiv preprint arXiv:2411.17470},
  year   = {2025}
}