Video-T1:视频生成的测试时比例扩展
计算机视觉与模式识别
2025-04-02 v2 人工智能
摘要
随着通过增加训练数据、模型规模和计算资源来实现的规模能力,视频生成已在数字创作领域取得了令人印象深刻的成果,使用户能够在各种领域表达创意。最近,大型语言模型(LLM)研究者已将比例扩展扩展到测试时,这显著提高了 LLM 的性能,通过使用更多推理计算资源。本文探索在不通过高昂的训练成本来扩大视频基础模型的能力,旨在回答以下问题:如果允许视频生成模型使用非平凡的推理计算资源,给定具有挑战性文本提示时,生成质量能提升多少。本文将视频生成的测试时比例扩展重新解释为从高斯噪声空间采样更佳轨迹的搜索问题。具体而言,我们构建具有测试时验证器以提供反馈和启发式算法以引导搜索过程的搜索空间。给定文本提示后,我们首先通过增加噪声候选数实现直观的线性搜索策略。在全步骤去噪所有帧同时进行时需要巨大的测试时计算成本,因此我们进一步设计了一种更高效的视频生成方法,称为 Tree-of-Frames(ToF),以自回归方式自适应扩展和修剪视频分支。对文本条件视频生成基准进行大量实验表明,增加测试时计算 consistently 导致视频质量显著提升。项目页面:https://liuff19.github.io/Video-T1
引用
@article{arxiv.2503.18942,
title = {Video-T1: Test-Time Scaling for Video Generation},
author = {Fangfu Liu and Hanyang Wang and Yimo Cai and Kaiyan Zhang and Xiaohang Zhan and Yueqi Duan},
journal= {arXiv preprint arXiv:2503.18942},
year = {2025}
}
备注
Project page: https://liuff19.github.io/Video-T1