CLTA:基于内容与长度的时间注意力少样本动作识别
计算机视觉与模式识别
2021-03-22 v1
摘要
由于难以获取恰当标注的训练样本,少样本动作识别吸引了越来越多的关注。现有工作表明,保留空间信息并比较视频描述符对少样本动作识别至关重要。然而,保留时间信息的重要性尚未得到充分讨论。本文提出一种基于内容与长度的时间注意力(CLTA)模型,其为单个视频学习定制化时间注意力以应对少样本动作识别问题。CLTA利用高斯似然函数作为模板生成时间注意力,并基于帧内容与时长训练学习矩阵以求得均值与标准差。我们表明,即便未微调的骨干网络配合普通 softmax 分类器,在精确捕获时间注意力的情况下仍可获得与最先进少样本动作识别方法相似或更好的结果。
引用
@article{arxiv.2103.10567,
title = {CLTA: Contents and Length-based Temporal Attention for Few-shot Action Recognition},
author = {Yang Bo and Yangdi Lu and Wenbo He},
journal= {arXiv preprint arXiv:2103.10567},
year = {2021}
}
备注
8 pages, 4 figures