中文

StarVid:通过空间与句法引导注意力重新聚焦提升视频扩散模型的语义对齐

计算机视觉与模式识别 2025-03-04 v2 人工智能

摘要

近期的文本到视频(T2V)生成技术基于扩散模型取得了显著进展,但通常在单一物体和简单运动的场景中表现良好,在包含多个物体和不同运动的组合场景中难以准确反映文本提示的语义内容。为此,我们提出了StarVid,一种即插即用且无需训练的方法,用于改进T2V模型中多个主体、其运动与文本提示之间的语义对齐。StarVid首先利用大语言模型(LLM)的空间推理能力,基于文本提示进行两阶段运动轨迹规划。这些轨迹作为空间先验,引导空间感知损失,将交叉注意力(CA)图重新聚焦到特定区域。此外,我们提出了一种语法引导的对比约束,以强化动词及其对应名词的CA图之间的关联,增强运动与主体的绑定。定性和定量评估均表明,所提出的框架显著优于基线方法,生成的视频在语义一致性方面具有更高质量。

关键词

引用

@article{arxiv.2409.15259,
  title  = {StarVid: Enhancing Semantic Alignment in Video Diffusion Models via Spatial and SynTactic Guided Attention Refocusing},
  author = {Yuanhang Li and Qi Mao and Lan Chen and Zhen Fang and Lei Tian and Xinyan Xiao and Libiao Jin and Hua Wu},
  journal= {arXiv preprint arXiv:2409.15259},
  year   = {2025}
}