中文

面向零样本动作识别的对比嵌入方法——CEZSAR

计算机视觉与模式识别 2026-05-05 v1

摘要

本文提出一种基于对比学习的 novel Zero-Shot Action Recognition(ZSAR)方法。ZSAR旨在对训练时未出现的类别进行分类。ZSAR中仍存两个经典问题:语义鸿沟与域迁移。语义鸿沟源于标签表征来自文本域(即语言模型),而必须与视觉表征(即CNN、RNN、基于Transformer的模型)关联;这种多模态特性意味着两空间的语义属性并不相同。域迁移则源于训练集与测试集之间的差异,在ZSAR中是固有的,因为测试集是未知的。学习联合嵌入空间是解决上述两个问题的最有前景的方法之一。因此,我们提出了新模型,对视频与句子进行联合嵌入空间编码,通过对齐视频与其自然语言描述进行训练。我们设计了自动负采样程序以扩充训练数据集,生成未成对的数据,即视觉外观与无关描述。我们的结果在UCF-101和Kinetics-400数据集上实现了在多种划分配置下的state-of-the-art性能。我们的代码已公开于https://github.com/valterlej/cezsar。

关键词

引用

@article{arxiv.2605.01165,
  title  = {CEZSAR: A Contrastive Embedding Method for Zero-Shot Action Recognition},
  author = {Valter Estevam and Rayson Laroca and Helio Pedrini and David Menotti},
  journal= {arXiv preprint arXiv:2605.01165},
  year   = {2026}
}

备注

Accepted for presentation at the International Conference on Pattern Recognition (ICPR) 2026