EZ-CLIP:高效的零样本视频动作识别
计算机视觉与模式识别
2024-01-22 v2 机器学习
摘要
近期在成对图文数据上进行视觉-语言模型大规模预训练的进展,展示了零样本任务令人印象深刻的泛化能力。基于这一成功,研究人员致力于将这些基于图像的视觉-语言模型(如CLIP)适配到视频中,将其零样本能力扩展到视频领域。虽然这些适配显示出有希望的结果,但它们伴随着巨大的计算成本,并且在有效建模视频领域固有的关键时序方面存在困难。在本研究中,我们提出了EZ-CLIP,这是一种简单且高效的CLIP适配方法,解决了这些挑战。EZ-CLIP利用时序视觉提示实现无缝的时序适配,无需对核心CLIP架构进行根本性改变,同时保留了其出色的泛化能力。此外,我们引入了一种新颖的学习目标,引导时序视觉提示专注于捕捉运动,从而增强其从视频数据中学习的能力。我们在五个不同的基准数据集上进行了广泛实验,全面评估了EZ-CLIP在零样本学习和从基础到新类的视频动作识别方面的表现,并展示了其在少样本泛化方面的潜力。令人印象深刻的是,EZ-CLIP仅需520万可学习参数(相比之下,此前最佳模型为7110万),即可在单GPU上高效训练,并在多项评估中超越现有方法。
引用
@article{arxiv.2312.08010,
title = {EZ-CLIP: Efficient Zeroshot Video Action Recognition},
author = {Shahzad Ahmad and Sukalpa Chanda and Yogesh S Rawat},
journal= {arXiv preprint arXiv:2312.08010},
year = {2024}
}