中文

基于合成视频的大规模预训练模型手势识别评估

计算机视觉与模式识别 2024-10-04 v1

摘要

本工作探索了使用合成生成数据进行基于视频的手势识别的可能性。我们考察这些模型是否具有足够稳健和表征性的表示空间,以实现“无训练”分类。具体而言,我们利用各种最新视频编码器提取用于k近邻分类的特征,其中训练数据点来自合成视频。我们将这些结果与另一种无训练方法进行比较,即使用每种手势的文本描述进行零样本分类。在我们的RoCoG-v2数据集实验中,我们发现使用合成训练视频在真实测试视频上的分类准确率显著低于使用相对较少的真实训练视频。我们还观察到,针对分类任务进行微调的视频主干模型作为更优特征提取器,微调数据的选择对k近邻性能具有重大影响。最后,我们发现基于零样本文本分类在手势识别任务上表现不佳,因为手势难以通过自然语言描述。

关键词

引用

@article{arxiv.2410.02152,
  title  = {An Evaluation of Large Pre-Trained Models for Gesture Recognition using Synthetic Videos},
  author = {Arun Reddy and Ketul Shah and Corban Rivera and William Paul and Celso M. De Melo and Rama Chellappa},
  journal= {arXiv preprint arXiv:2410.02152},
  year   = {2024}
}

备注

Synthetic Data for Artificial Intelligence and Machine Learning: Tools, Techniques, and Applications II (SPIE Defense + Commercial Sensing, 2024)