可解释运动注意图:视频扩散变换器中的时空局部化概念
计算机视觉与模式识别
2026-03-10 v2 人工智能
机器学习
摘要
视频扩散变换器 (DiT) 已能够从包含运动描述的文本中合成高保真度的高质量视频,但我们对 Video DiTs 将运动词语转化为视频的方式仍不充分了解。此外,虽然先前的可解释显著图研究主要针对对象,但 Video DiTs 关于运动相关行为的研究仍有限。本文我们调查具体的运动特征,用于指定给定运动概念的何时何地移动哪个对象。首先,为实现空间局部化,我们引入 GramCol,该方法可为任何文本概念(包括运动和非运动)自适应地生成每帧显著图。其次,我们提出一种运动特征选择算法,以获得可解释的运动注意图 (IMAP),实现对运动的时空局部化。该方法无需进行任何梯度计算或参数更新,即可发现概念显著图。实验表明,我们的方法在运动局部化任务和零样视频语义分割方面表现出色,为运动和非运动概念提供了可解释且清晰的显著图。
引用
@article{arxiv.2603.02919,
title = {Interpretable Motion-Attentive Maps: Spatio-Temporally Localizing Concepts in Video Diffusion Transformers},
author = {Youngjun Jun and Seil Kang and Woojung Han and Seong Jae Hwang},
journal= {arXiv preprint arXiv:2603.02919},
year = {2026}
}
备注
CVPR 2026