面向少样本动作识别的语义感知视频表示
计算机视觉与模式识别
2023-11-13 v1
摘要
近期动作识别工作利用三维特征与文本信息取得了最先进性能。然而,当前多数少样本动作识别方法仍依赖二维帧级表示,常需额外组件建模时间关系,并采用复杂距离函数实现这些表示的精确对齐。此外,现有方法难以有效整合文本语义,有些将文本与视觉特征拼接或相加,有些仅将文本作为额外监督而未真正实现特征融合与跨模态信息迁移。本文提出一种简洁而有效的语义感知少样本动作识别(SAFSAR)模型以解决上述问题。我们表明,直接结合三维特征提取器与有效特征融合方案,以及用于分类的简单余弦相似度,可在无需时间建模额外组件或复杂距离函数的情况下取得更优性能。我们引入一种创新方案将文本语义编码进视频表示,自适应融合文本与视频特征,并促使视觉编码器提取语义更一致的特征。该方案使 SAFSAR 以紧凑方式实现对齐与融合。在五个具挑战性的少样本动作识别基准及各种设定下的实验表明,所提 SAFSAR 模型显著提升了最先进性能。
引用
@article{arxiv.2311.06218,
title = {Semantic-aware Video Representation for Few-shot Action Recognition},
author = {Yutao Tang and Benjamin Bejar and Rene Vidal},
journal= {arXiv preprint arXiv:2311.06218},
year = {2023}
}
备注
WACV2024