Comp-Attn:用于组合视频生成的Present-and-Align注意力
计算机视觉与模式识别
2025-12-23 v2 人工智能
摘要
在文本到视频(T2V)生成领域,可靠地合成涉及多个具有复杂关系的组成内容仍未得到充分探索。主要挑战有两个:1)主体存在问题,即并非所有主体都能在视频中呈现;2)主体关系问题,即主体之间的相互作用和空间关系错位。现有方法采用推理时潜在优化或布局控制等技术,无法同时解决这两个问题。为解决这些问题,我们提出 Comp-Attn,一种遵循Present-and-Align范式的组合感知交叉注意力变体:它在条件层面确保主体存在,在注意力分布层面实现关系对齐。具体而言,1)我们引入主体感知条件插值(SCI),强化主体特定条件,确保每个主体的存在;2)我们提出布局强制注意力调制(LAM),动态强制注意力分布与多个主体的关系布局对齐。Comp-Attn 可无缝集成到各种 T2V 基线中,以训练-free方式提升 Wan2.1-T2V-14B 和 Wan2.2-T2V-A14B 在 T2V-CompBench 中的得分分别提高 15.7% 和 11.7%,仅增加 5% 的推理时间。同时,它在 VBench 和 T2I-CompBench 上也取得优异成绩,显示其在通用视频生成和组合文本到图像(T2I)任务中的可扩展性。
引用
@article{arxiv.2503.14428,
title = {Comp-Attn: Present-and-Align Attention for Compositional Video Generation},
author = {Hongyu Zhang and Yufan Deng and Shenghai Yuan and Yian Zhao and Peng Jin and Xuehan Hou and Chang Liu and Jie Chen},
journal= {arXiv preprint arXiv:2503.14428},
year = {2025}
}