中文

Kronecker 掩码与解释性提示:语言-动作视频学习器

计算机视觉与模式识别 2025-02-11 v3

摘要

对比语言-图像预训练(CLIP)显著推动了基于图像的视觉学习。一个紧迫的后续问题随之而来:我们如何有效地将 CLIP 适配到视频领域?最近的研究集中于调整 CLIP 的文本或视觉分支以进行动作识别。然而,我们认为两个分支的适配都至关重要。在本文中,我们提出了 CLAVER:一个对比语言-动作视频学习器,旨在将 CLIP 的关注点从静态视觉对象与具体名词的对齐,转移到动态动作行为与抽象动词的对齐。具体来说,我们引入了一种新颖的 Kronecker 掩码注意力机制用于时序建模。我们定制的 Kronecker 掩码具有三个优点:1)它扩展了每个 token 的时序感受野;2)它作为一种有效的时空异质性归纳偏置,缓解了时空同质化问题;3)它可以无缝地插入到基于 Transformer 的模型中。关于文本分支,我们利用大型语言模型生成多样化、句子级且语义丰富的动作解释性提示,从而将模型的关注点转向动词理解。在各种基准和学习场景上的大量实验证明了我们方法的优越性和通用性。

关键词

引用

@article{arxiv.2502.03549,
  title  = {Kronecker Mask and Interpretive Prompts are Language-Action Video Learners},
  author = {Jingyi Yang and Zitong Yu and Xiuming Ni and Jia He and Hui Li},
  journal= {arXiv preprint arXiv:2502.03549},
  year   = {2025}
}

备注

Accepted to ICLR 2025