TS-Attn:面向多事件视频生成的时序分离注意力机制
计算机视觉与模式识别
2026-04-22 v1
摘要
从包含多个顺序动作的复杂时序描述生成高质量视频是尚未解决的关键问题。现有方法受制于固有的权衡:使用多个短提示依次输入模型可提升动作忠实度,但牺牲时序一致性;而单一复杂提示则保留一致性,却牺牲提示跟随能力。我们认为这一问题源于两个主要因素:其一,视频内容与提示之间的时序错位;其二,与动作相关的视觉对象及其关联文本条件之间的注意力耦合冲突。为此,我们提出一种新型、无需训练的注意力机制——时序分离注意力(Temporal-wise Separable Attention, TS-Attn),通过动态重排注意力分布,确保多事件情景下的时序感知和全局一致性。TS-Attn可无缝集成至各种预训练文本到视频模型,仅增加约2%的推理时间,即可使StoryEval-Bench在Wan2.1-T2V-14B和Wan2.2-T2V-A14B上提升33.5%和16.4%。它还支持在多事件图像到视频生成中实现即插即用。源代码和项目页面已公开:https://github.com/Hong-yu-Zhang/TS-Attn。
引用
@article{arxiv.2604.19473,
title = {TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation},
author = {Hongyu Zhang and Yufan Deng and Zilin Pan and Peng-Tao Jiang and Bo Li and Qibin Hou and Zhiyang Dou and Zhen Dong and Daquan Zhou},
journal= {arXiv preprint arXiv:2604.19473},
year = {2026}
}
备注
ICLR 2026, code available at: https://github.com/Hong-yu-Zhang/TS-Attn