中文

利用合成富文本视频进行视频文本保留

计算机视觉与模式识别 2025-11-11 v1 人工智能

摘要

尽管文本到视频(T2V)模型发展迅速,但它们在生成视频中清晰且连贯的文本方面仍存在困难。特别是,现有模型往往无法正确渲染哪怕是短词组或单词,而以往解决此问题的尝试计算成本高昂且不适用于视频生成。在本研究中,我们探索了一种利用合成监督来改进T2V扩散模型的轻量级方法。我们首先使用文本到图像(T2I)扩散模型生成富文本图像,然后使用与文本无关的图像到视频(I2v)模型将其生成为短视频。这些合成视频-提示对被用于微调预训练的T2V模型Wan2.1,且无需任何架构上的改变。结果表明,该方法提升了短文本的清晰度与时序一致性,并为长文本带来了新兴的结构先验。这些发现表明,精心策划的合成数据与弱监督为提升T2V生成中的文本保真度提供了一条实用路径。

关键词

引用

@article{arxiv.2511.05573,
  title  = {Video Text Preservation with Synthetic Text-Rich Videos},
  author = {Ziyang Liu and Kevin Valencia and Justin Cui},
  journal= {arXiv preprint arXiv:2511.05573},
  year   = {2025}
}