面向少样本动作识别的任务特定对齐与多级Transformer
计算机视觉与模式识别
2023-12-04 v2 离散数学
摘要
在少样本学习研究领域中,基于图像与基于视频的主要区别在于额外的时间维度。近年来,一些工作使用Transformer处理帧,进而获得注意力特征与增强原型,结果具有竞争力。然而,部分视频帧可能与动作关联甚微,且仅使用单帧级或片段级特征可能无法挖掘足够信息。我们通过一种端到端方法“任务特定对齐与多级Transformer网络(TSA-MLT)”依次解决这些问题。第一模块(TSA)旨在过滤与动作无关的帧以实现动作时长对齐。对时间维度上的帧序列采用仿射变换进行线性采样。第二模块(MLT)聚焦于支持原型与查询样本的多级特征,以挖掘更多对齐信息,其作用于不同层级特征。我们采用基于融合距离的融合损失,该融合距离融合了关注时间顺序对齐的L2序列距离,以及关注度量视频外观与语义差距的最优传输距离。大量实验表明,我们的方法在HMDB51与UCF101数据集上取得SOTA结果,并在Kinetics与something-2-something V2数据集基准上取得具竞争力的结果。我们的代码见URL:https://github.com/cofly2014/tsa-mlt.git
引用
@article{arxiv.2307.01985,
title = {Task-Specific Alignment and Multiple Level Transformer for Few-Shot Action Recognition},
author = {Fei Guo and Li Zhu and YiWang Wang and Jing Sun},
journal= {arXiv preprint arXiv:2307.01985},
year = {2023}
}