中文

用于少样本动作识别的一致性原型模块与运动补偿(CLIP-CP$\mathbf{M^2}$C)

计算机视觉与模式识别 2023-12-05 v1

摘要

近来,少样本动作识别通过学些特征可判别性与设计合适的比较方法取得了显著进展。然而,仍存在以下局限。(a) 以往工作主要基于视觉单模态。尽管部分多模态工作利用标签作为补充来构建支持视频的原型,却无法将该信息用于查询视频。标签未被高效利用。(b) 大多数工作忽略了视频的运动特征,尽管运动特征对区分至关重要。我们提出一种一致性原型与运动补偿网络(CLIP-CPM2M^2C)以解决这些问题。首先,我们利用 CLIP 进行多模态少样本动作识别,通过文本-图像比较实现域适应。其次,为使原型与查询之间的信息量更为相似,我们提出一种在文本(提示)不存在时补偿查询视频文本(提示)信息的新方法,其依赖于一致性损失(Consistency Loss)。第三,我们将两个方向上相邻帧的差分特征作为运动特征,显式地将运动动态嵌入网络。我们还将一致性损失应用于运动特征。在标准基准数据集上的大量实验表明,所提方法能与最先进的结果相媲美。我们的代码可见于 URL:https://github.com/xxx/xxx.git。

关键词

引用

@article{arxiv.2312.01083,
  title  = {Consistency Prototype Module and Motion Compensation for Few-Shot Action Recognition (CLIP-CP$\mathbf{M^2}$C)},
  author = {Fei Guo and Li Zhu and YiKang Wang and Han Qi},
  journal= {arXiv preprint arXiv:2312.01083},
  year   = {2023}
}