中文

用于连贯文本到视频叙事的场景-动作提示融合

计算机视觉与模式识别 2026-05-20 v4

摘要

由于难以在各个片段之间保持时间连贯性、语义一致性以及场景-动作连续性,从离散文本提示生成连贯的长视频序列仍然具有挑战性。我们提出了一种新颖的叙事框架,通过受动力学启发的提示混合来整合场景和动作提示。我们的方法结合了三个关键组件: 双向时间加权潜空间混合策略,在连续视频片段之间强制实施时间一致性; 动力学信息提示加权(DIPW)机制,基于 CLIP 对齐、叙事进展和时间平滑度,在每个扩散时间步自适应地平衡场景和动作提示; 语义动作表示,编码高级动作语义以根据动作相似性调制过渡。潜空间混合保持了场景内的空间连贯性,而时间加权混合引入了双向时间约束以防止突变过渡。这些组件共同实现了流畅且连贯的视频叙事,忠实地反映了场景上下文和动作动力学。大量实验表明,我们的方法显著优于基线方法,在无需任何额外训练的情况下生成了时间一致且视觉上引人注目的长视频,从而弥合了短视频片段与扩展的文本驱动视频叙事之间的差距。

关键词

引用

@article{arxiv.2503.06310,
  title  = {Scene-Action Prompt Fusion for Coherent Text-to-Video Storytelling},
  author = {Taewon Kang and Divya Kothandaraman and Ming C. Lin},
  journal= {arXiv preprint arXiv:2503.06310},
  year   = {2026}
}

备注

Accepted to the 2026 IEEE International Conference on Image Processing (ICIP 2026). 13 pages, 4 figures