Seeing in Flowing:利用运动提示学习使 CLIP 适应动作识别
计算机视觉与模式识别
2023-08-10 v1
摘要
对比语言-图像预训练(CLIP)近来在“零样本”训练上展现出卓越的泛化能力,并已应用于许多下游任务。我们探索对 CLIP 进行适配,以实现更高效且更具泛化性的动作识别方法。我们提出,关键在于显式建模视频帧中流动的运动线索。为此,我们设计了一个双流运动建模模块,以同时捕获运动与空间信息。随后,所获得的运动线索被用于驱动一个动态提示学习器,生成包含丰富关于人类动作语义信息的运动感知提示。此外,我们提出了一种多模态通信模块以实现协同学习并进一步提升性能。我们在 HMDB-51、UCF-101 和 Kinetics-400 数据集上进行了大量实验。我们的方法在“少样本”和“零样本”训练上以显著优势超越大多数现有最先进方法。我们还在“闭集”训练上以极少的可训练参数和额外计算成本取得了具有竞争力的性能。
引用
@article{arxiv.2308.04828,
title = {Seeing in Flowing: Adapting CLIP for Action Recognition with Motion Prompts Learning},
author = {Qiang Wang and Junlong Du and Ke Yan and Shouhong Ding},
journal= {arXiv preprint arXiv:2308.04828},
year = {2023}
}
备注
Accepted by ACM MM 2023