AlignVid:面向语义忠实度的文本引导图像到视频生成的训练-free 注意力缩放
计算机视觉与模式识别
2026-05-29 v2
摘要
文本引导的图像到视频生成取得了显著进展,但仍难以执行需要对参考图像进行大幅修改的文本指定编辑(例如对象添加、删除或修改)。我们通过经验性分析发现,这源于\textbf{视觉主导}(visual dominance),即参考图像导致注意力分散,阻碍模型融合新语义信息的能力。为此,我们提出了\textbf{AlignVid},一种无需训练的干预方法,通过重新校准模型的内部注意力分布。基于能量视角下的注意力,AlignVid采用注意力缩放调制(\textbf{ASM})以降低注意力熵并集中关注语义标记,同时引入引导调度(\textbf{GS})以维持生成稳定性。为严格评估此能力,我们提出了\textbf{OmitI2V},用于评估提示词一致性的综合基准,涵盖对象修改、添加和删除。大量实验表明,AlignVid在几乎没有计算开销的情况下有效提升了语义忠实度。代码和OmitI2V基准已发布于https://github.com/LAW1223/AlignVid。
引用
@article{arxiv.2512.01334,
title = {AlignVid: Training-Free Attention Scaling for Semantic Fidelity in Text-Guided Image-to-Video Generation},
author = {Yexin Liu and Wen-Jie Shu and Zile Huang and Haoze Zheng and Yueze Wang and Jingjin Zhu and Manyuan Zhang and Ser-Nam Lim and Harry Yang},
journal= {arXiv preprint arXiv:2512.01334},
year = {2026}
}