ActNetFormer:用于视频半监督动作识别的 Transformer-ResNet 混合方法
计算机视觉与模式识别
2024-04-10 v1 人工智能
人机交互
机器学习
多媒体
摘要
视频中的人类动作或活动识别是计算机视觉中的一项基本任务,可应用于监控、自动驾驶汽车、体育分析、人机交互等众多领域。传统的监督方法需要大量标注数据集进行训练,这些数据的获取既昂贵又耗时。本工作提出了一种新颖的方法,使用跨架构伪标签与对比学习进行半监督动作识别。我们的框架利用标记和未标记数据来稳健地学习视频中的动作表示,将伪标签与对比学习相结合,以从两种类型的样本中有效学习。我们引入了一种新颖的跨架构方法,其中利用 3D 卷积神经网络(3D CNN)和视频 Transformer(VIT)来捕捉动作表示的不同方面;因此我们将其称为 ActNetFormer。3D CNN 擅长捕捉空间特征和时间域中的局部依赖关系,而 VIT 擅长捕捉跨帧的长距离依赖关系。通过在 ActNetFormer 框架内整合这些互补的架构,我们的方法可以有效地捕捉动作的局部和全局上下文信息。这种全面的表示学习使模型能够通过发挥每种架构的优势,在半监督动作识别任务中取得更好的性能。在标准动作识别数据集上的实验结果表明,我们的方法优于现有方法,仅使用一小部分标记数据即实现了 SOTA 性能。本工作的官方网站位于:https://github.com/rana2149/ActNetFormer。
引用
@article{arxiv.2404.06243,
title = {ActNetFormer: Transformer-ResNet Hybrid Method for Semi-Supervised Action Recognition in Videos},
author = {Sharana Dharshikgan Suresh Dass and Hrishav Bakul Barua and Ganesh Krishnasamy and Raveendran Paramesran and Raphael C. -W. Phan},
journal= {arXiv preprint arXiv:2404.06243},
year = {2024}
}
备注
Submitted for peer review