利用时间上下文化进行视频动作识别
计算机视觉与模式识别
2024-07-25 v2
摘要
我们提出了一种新颖的视频理解框架,称为时间上下化 CLIP (TC-CLIP),它通过视频内时空域中的全局交互来利用基本的时间信息。具体而言,我们引入了时间上下文化 (TC),一种用于视频的逐层时间信息注入机制,它 1) 从每一帧中提取核心信息,2) 连接跨帧的相关信息以将其概括为上下文 token,以及 3) 利用上下文 token 进行特征编码。此外,视频条件提示 (VP) 模块处理上下文 token 以在文本模态中生成信息性提示。在零样本、少样本、基类到新类和完全监督动作识别方面的大量实验验证了我们模型的有效性。对 TC 和 VP 的消融研究支持了我们的设计选择。包含源代码的项目页面可在 https://github.com/naver-ai/tc-clip 获取
引用
@article{arxiv.2404.09490,
title = {Leveraging Temporal Contextualization for Video Action Recognition},
author = {Minji Kim and Dongyoon Han and Taekyung Kim and Bohyung Han},
journal= {arXiv preprint arXiv:2404.09490},
year = {2024}
}
备注
26 pages, 11 figures, 16 tables. To be presented at ECCV'24