中文

EV-CLIP:面向视觉挑战下少样本动作识别的高效视觉提示适配

计算机视觉与模式识别 2026-04-27 v1

摘要

CLIP通过自然语言监督在视觉领域展现出强大的泛化能力,甚至适用于视频动作识别。然而,现有大多数针对动作识别适配CLIP的方法主要聚焦于时序建模,往往忽视了空间感知。在实际场景中,视觉挑战如低光环境或第三人称视角等会严重损害空间理解,这是有效时序推理的关键前提。为此,我们提出了面向少样本视频动作识别的高效视觉提示适配框架——EV-CLIP。EV-CLIP引入两种视觉提示:掩码提示通过对像素进行重新加权,引导模型注意力聚焦于与动作相关的区域;上下文提示通过压缩帧级特征至紧凑表示,实现轻量级时序建模。为进行全面评估,我们精选了五个基准数据集,并分析了领域偏移,以量化不同视觉与语义因素对动作识别的影响。实验结果表明,EV-CLIP在整体性能上超越了现有参数高效方法。此外,其效率与 backbone 规模无关,使其非常适合部署于实际资源受限的场景。代码已公开于 https://github.com/AI-CV-Lab/EV-CLIP。

关键词

引用

@article{arxiv.2604.22595,
  title  = {EV-CLIP: Efficient Visual Prompt Adaptation for CLIP in Few-shot Action Recognition under Visual Challenges},
  author = {Hyo Jin Jon and Longbin Jin and Eun Yi Kim},
  journal= {arXiv preprint arXiv:2604.22595},
  year   = {2026}
}

备注

14 pages, 8 figures, 6 tables