用于孤立手语识别的自监督视频 Transformer
计算机视觉与模式识别
2023-09-07 v1
摘要
本文对多种用于孤立手语识别(ISLR)的自监督方法进行了深入分析。我们考虑了四种近期提出的基于 Transformer 的视频自监督学习方法,以及四种预训练数据机制,并在 WLASL2000 数据集上研究了所有组合。我们的发现表明,MaskFeat 取得了优于基于姿态和 supervised 视频模型的性能,在基于词义(gloss)的 WLASL2000 上 top-1 准确率达 79.02%。此外,我们利用在多种音系特征上的线性探测(linear probing)分析了这些模型生成 ASL 手语表征的能力。本研究强调了架构与预训练任务选择在 ISLR 中的价值。具体而言,我们在 WLASL2000 上的结果凸显了掩码重建预训练的功效,而我们的线性探测结果表明了分层视觉 Transformer 对于手语表征的重要性。
引用
@article{arxiv.2309.02450,
title = {Self-Supervised Video Transformers for Isolated Sign Language Recognition},
author = {Marcelo Sandoval-Castaneda and Yanhong Li and Diane Brentari and Karen Livescu and Gregory Shakhnarovich},
journal= {arXiv preprint arXiv:2309.02450},
year = {2023}
}
备注
14 pages. Submitted to WACV 2024