中文

AI 驱动的高质量文本到视频生成:增强时序一致性

计算机视觉与模式识别 2025-11-04 v1 人工智能 信息检索

摘要

文本到视频生成已成为生成式人工智能中的关键前沿,但现有方法在保持时序一致性、理解构图以及对视觉叙事进行细粒度控制方面存在挑战。我们提出 MOVAI(Multimodal Original Video AI),一个新颖的分层框架,将构图场景理解与时序感知扩散模型集成,用于高保真文本到视频合成。我们的框架引入了三个关键创新:(1)一种构图场景解析器(CSP),将文本描述分解为带有时序注释的层次化场景图;(2)一种时空注意力机制(TSAM),确保跨帧的连贯运动动态,同时保持空间细节;(3)一种渐进视频精炼(PVR)模块,通过多尺度时序推理持续增强视频质量。广泛的实验在标准基准上表明,MOVAI 实现了最前沿的性能,在 LPIPS 指标上提升 15.3%,FVD 指标上提升 12.7%,用户偏好研究中提升 18.9%。我们的框架在生成具有真实时序动态和细粒度语义控制的复杂多对象场景方面表现尤为出色。

关键词

引用

@article{arxiv.2511.00107,
  title  = {AI Powered High Quality Text to Video Generation with Enhanced Temporal Consistency},
  author = {Piyushkumar Patel},
  journal= {arXiv preprint arXiv:2511.00107},
  year   = {2025}
}