RISE-T2V:基于LLM的文本到视频生成语义重述与注入
计算机视觉与模式识别
2025-11-07 v1
摘要
大多数文本到视频 (T2V) 扩散模型依赖预训练文本编码器进行语义对齐,但在提供简洁提示词而非经过精心设计的提示词时,往往难以维持视频质量。其根本问题在于其对文本语义理解能力有限。此外,这些文本编码器无法在线重述提示词以更好地对齐用户意图,这限制了模型的可扩展性和可用性。为此,我们提出RISE-T2V,将提示词重述与语义特征提取过程唯一地集成到单个无缝步骤中,而非两个分离步骤。RISE-T2V是通用且可应用于各种预训练LLM和视频扩散模型 (VDMs) 的,显著提升了其进行T2V任务的能力。我们提出一种创新模块——重述适配器 (Rephrasing Adapter),使扩散模型能够在LLM的下一个token预测中利用文本隐藏状态作为视频生成的条件。通过采用重述适配器,视频生成模型能够隐式地将基础提示词重述为更全面的表述,从而更好地匹配用户意图。进一步地,我们利用LLM的强大能力,使视频生成模型能够完成更广泛的T2V任务。大量实验表明,RISE-T2V是一个通用框架,可应用于不同的视频扩散模型架构,显著提升了T2V模型生成符合用户意图的高质量视频的能力。视觉结果已在网页 https://rise-t2v.github.io 上提供。
引用
@article{arxiv.2511.04317,
title = {RISE-T2V: Rephrasing and Injecting Semantics with LLM for Expansive Text-to-Video Generation},
author = {Xiangjun Zhang and Litong Gong and Yinglin Zheng and Yansong Liu and Wentao Jiang and Mingyi Xu and Biao Wang and Tiezheng Ge and Ming Zeng},
journal= {arXiv preprint arXiv:2511.04317},
year = {2025}
}
备注
17 pages, 16 figures