中文

先对齐后适配:利用实体到区域对齐实现可泛化视频动作识别

计算机视觉与模式识别 2024-03-22 v3 人工智能

摘要

大规模视觉-语言预训练模型已在各种视频任务中取得显著成功。然而,大多数现有方法遵循“先适配后对齐”范式,即适配预训练图像编码器以建模视频级表示,并利用动作标签的独热编码或文本嵌入进行监督。该范式忽视了从静态图像映射到复杂活动概念的挑战。在本文中,我们提出一种新颖的“先对齐后适配”(ALT)范式。在适配到视频表示学习之前,我们利用每帧的实体到区域对齐。该对齐通过将区域感知图像嵌入与离线构建的文本语料库匹配来实现。利用对齐的实体,我们将其文本嵌入作为基于transformer的视频适配器的查询,这有助于从视频中提取最重要实体的语义到一个向量中。该范式在适配过程中复用了VLP的视觉-语言对齐,并试图通过底层实体来解释动作。这有助于通过弥合与复杂活动语义的差距来理解动作,尤其是在面对不熟悉或未见过的类别时。ALT在保持极低计算成本的同时展示了具有竞争力的性能。在全监督实验中,它以仅4947 GFLOPs在Kinetics-400上达到88.1%的top-1准确率。此外,ALT在零样本和少样本实验中均优于先前的最先进方法,强调了其在各种学习场景下的优越泛化能力。

关键词

引用

@article{arxiv.2311.15619,
  title  = {Align before Adapt: Leveraging Entity-to-Region Alignments for Generalizable Video Action Recognition},
  author = {Yifei Chen and Dapeng Chen and Ruijin Liu and Sai Zhou and Wenyuan Xue and Wei Peng},
  journal= {arXiv preprint arXiv:2311.15619},
  year   = {2024}
}

备注

Accepted at CVPR 2024