中文

AlignVid:面向语义忠实度的文本引导图像到视频生成的训练-free 注意力缩放

计算机视觉与模式识别 2026-05-29 v2

摘要

文本引导的图像到视频生成取得了显著进展,但仍难以执行需要对参考图像进行大幅修改的文本指定编辑(例如对象添加、删除或修改)。我们通过经验性分析发现,这源于\textbf{视觉主导}(visual dominance),即参考图像导致注意力分散,阻碍模型融合新语义信息的能力。为此,我们提出了\textbf{AlignVid},一种无需训练的干预方法,通过重新校准模型的内部注意力分布。基于能量视角下的注意力,AlignVid采用注意力缩放调制(\textbf{ASM})以降低注意力熵并集中关注语义标记,同时引入引导调度(\textbf{GS})以维持生成稳定性。为严格评估此能力,我们提出了\textbf{OmitI2V},用于评估提示词一致性的综合基准,涵盖对象修改、添加和删除。大量实验表明,AlignVid在几乎没有计算开销的情况下有效提升了语义忠实度。代码和OmitI2V基准已发布于https://github.com/LAW1223/AlignVid。

关键词

引用

@article{arxiv.2512.01334,
  title  = {AlignVid: Training-Free Attention Scaling for Semantic Fidelity in Text-Guided Image-to-Video Generation},
  author = {Yexin Liu and Wen-Jie Shu and Zile Huang and Haoze Zheng and Yueze Wang and Jingjin Zhu and Manyuan Zhang and Ser-Nam Lim and Harry Yang},
  journal= {arXiv preprint arXiv:2512.01334},
  year   = {2026}
}