通过测试时训练实现一分钟视频生成
计算机视觉与模式识别
2025-04-08 v1
摘要
当今变换器在生成一分钟视频方面仍存在困难,因为自注意力层在长上下文情境下效率低下。诸如 Mamba 等替代方案在处理复杂多场景故事时因隐藏状态表达性不足而受限。我们实验性地使用测试时训练(Test-Time Training, TTT)层,其隐藏状态本身可为神经网络,从而更具表达性。将 TTT 层添加到预训练变换器后,即可从文本分镜生成一分钟视频。为验证效果,我们基于汤姆和杰里动画片构建了数据集。与 Mamba~2、Gated DeltaNet 和滑动窗口注意力层等基线方法相比,TTT 层生成的视频更连贯,能讲述复杂故事,在人类评估(每种方法 100 个视频)中领先 34 个 Elo 分数。尽管有前景,但生成结果仍含有伪影,可能源于 5B 参数的预训练模型能力受限。我们实现的效率也可进一步提升。仅针对一分钟视频进行实验是由于资源限制,但该方法可扩展至更长视频和更复杂的故事。样本视频、代码和标注已公开:https://test-time-training.github.io/video-dit
引用
@article{arxiv.2504.05298,
title = {One-Minute Video Generation with Test-Time Training},
author = {Karan Dalal and Daniel Koceja and Gashon Hussein and Jiarui Xu and Yue Zhao and Youjin Song and Shihao Han and Ka Chun Cheung and Jan Kautz and Carlos Guestrin and Tatsunori Hashimoto and Sanmi Koyejo and Yejin Choi and Yu Sun and Xiaolong Wang},
journal= {arXiv preprint arXiv:2504.05298},
year = {2025}
}
备注
CVPR 2025