SITAR:用于动作识别的半监督图像Transformer
计算机视觉与模式识别
2024-09-05 v1
摘要
从有限的标注视频集合中识别动作仍然是一个挑战,因为标注视觉数据不仅繁琐,而且由于其机密性质可能成本高昂。此外,使用深度D Transformer处理时空数据会引入显著的计算复杂度。在本文中,我们的目标是在半监督设置下解决视频动作识别问题,仅利用少量标注视频和一组未标注视频,以计算高效的方式进行。具体而言,我们将输入视频中的多帧重新排列为行列形式以构建超级图像。随后,我们利用大量未标注样本,并在编码后的超级图像上采用对比学习。我们提出的方法采用两条路径,为源自同一视频的时间增强超级图像生成表示。具体而言,我们利用2D图像Transformer生成表示,并应用对比损失函数,在最小化不同视频表示之间相似度的同时,最大化相同视频的表示。我们的方法在各种基准数据集上的半监督动作识别性能优于现有的SOTA方法,同时显著降低了计算成本。
引用
@article{arxiv.2409.02910,
title = {SITAR: Semi-supervised Image Transformer for Action Recognition},
author = {Owais Iqbal and Omprakash Chakraborty and Aftab Hussain and Rameswar Panda and Abir Das},
journal= {arXiv preprint arXiv:2409.02910},
year = {2024}
}
备注
Accepted at ICPR 2024