TV2TV:用于交错语言和视频生成的统一框架
机器学习
2025-12-15 v2 人工智能
计算与语言
计算机视觉与模式识别
摘要
视频生成模型正在快速进步,但仍在处理需要显著语义分支或对下一步该发生什么进行多次高层次推理的复杂视频输出方面受限。在本文中,我们提出了一种新的全息视频文本模型类,通过整合最近的 LM 推理思想来解决这一挑战。更具体地,我们提出了 TV2TV,一个统一的生成建模框架,将视频生成分解为交错的文本和视频生成过程。TV2TV 使用混合转换器 (MoT) 架构联合学习语言建模(下一个标记预测)和视频流匹配(下一个帧预测)。在推理时,TV2TV 可以在生成文本和视频帧之间交替,从而允许模型在生成帧之前通过文字"思考"随后要发生的事情。此设计将决定下一步该发生什么的责任卸载给语言建模塔,从而实现更好的视觉质量和提示对齐。它还实现了细粒度可控性,允许用户通过文本干预随时修改视频生成轨迹。在基于视频游戏数据的受控实验中,TV2TV 在视觉质量和可控性方面均取得显著改进。TV2TV 也扩展到自然视频,通过使用视觉语言模型 (VLM) 为体育视频添加交错的自然语言动作描述来实现。这一语料库上的训练产生了强大的视觉质量和提示对齐,凸显了该模型推理和生成复杂真实世界动作序列的能力。综上,这些结果凸显了 TV2TV 作为一种通向具有开放式文本推理和控制的视频生成的有前景的步骤。
引用
@article{arxiv.2512.05103,
title = {TV2TV: A Unified Framework for Interleaved Language and Video Generation},
author = {Xiaochuang Han and Youssef Emad and Melissa Hall and John Nguyen and Karthik Padthe and Liam Robbins and Amir Bar and Delong Chen and Michal Drozdzal and Maha Elbayad and Yushi Hu and Shang-Wen Li and Sreya Dutta Roy and Jakob Verbeek and XuDong Wang and Marjan Ghazvininejad and Luke Zettlemoyer and Emily Dinan},
journal= {arXiv preprint arXiv:2512.05103},
year = {2025}
}