用于零样本时空动作检测的交互感知提示
计算机视觉与模式识别
2023-09-21 v4 人工智能
摘要
时空动作检测的目标是确定视频中每个人动作发生的时间和位置,并对相应动作类别进行分类。现有多数方法采用全监督学习,需要大量训练数据,难以实现零样本学习。本文提出利用预训练的视觉-语言模型提取具有代表性的图像与文本特征,并通过不同交互模块建模这些特征之间的关系以获得交互特征。此外,我们利用该特征对每个标签进行提示,以获得更合适的文本特征。最后,我们计算每个标签的交互特征与文本特征之间的相似度以确定动作类别。在 J-HMDB 和 UCF101-24 数据集上的实验表明,所提出的交互模块与提示使视觉-语言特征对齐更好,从而在零样本时空动作检测上取得了优异精度。代码将发布于 https://github.com/webber2933/iCLIP。
引用
@article{arxiv.2304.04688,
title = {Interaction-Aware Prompting for Zero-Shot Spatio-Temporal Action Detection},
author = {Wei-Jhe Huang and Jheng-Hsien Yeh and Min-Hung Chen and Gueter Josmy Faure and Shang-Hong Lai},
journal= {arXiv preprint arXiv:2304.04688},
year = {2023}
}
备注
Accepted by ICCV Workshop 2023 (What is Next in Multimodal Foundation Models?)