让训练更灵活:面向部署效率的视频模型
计算机视觉与模式识别
2025-03-19 v1
摘要
流行的视频训练方法主要 operate on 来自预定时空网格的固定数量的 token,由于内在的视频冗余,导致准确率-计算量之间的trade-off次优。它们也缺乏对下游任务不同计算预算的适应性,阻碍了在实际场景中应用最具竞争力的模型。我们因此提出了一种新的测试设置——Token Optimization,以在不同预算下最大化输入信息,从而通过从更合适采样的视频中进行 token 选择来优化受限大小的输入 token 集合。为此,我们提出了一种新的数据增强工具 Flux。通过使采样网格灵活并利用 token 选择,它可以轻松集成到大多数流行的视频训练框架中,几乎不增加额外开销的情况下提升模型鲁棒性。我们将 Flux 集成到大规模视频预训练中, resulting 的 FluxViT 在广泛的任务上以标准成本下建立了新的最佳结果。值得注意的是,仅使用 1/4 的 token,即可匹配以前进行 Token Optimization 的最先进模型的性能,实现近 90% 的节省。所有模型和数据均可在 https://github.com/OpenGVLab/FluxViT 获取。
引用
@article{arxiv.2503.14237,
title = {Make Your Training Flexible: Towards Deployment-Efficient Video Models},
author = {Chenting Wang and Kunchang Li and Tianxiang Jiang and Xiangyu Zeng and Yi Wang and Limin Wang},
journal= {arXiv preprint arXiv:2503.14237},
year = {2025}
}