大语言时代的手势语言识别
计算机视觉与模式识别
2026-04-14 v1 计算与语言
摘要
最近的视觉语言模型(VLM)在广泛的多模态推理任务中展现出强大的性能。这引发了一个问题:这些通用型模型是否也能在没有任务特定训练的情况下解决专业的视觉识别问题,如孤立手势语言识别(ISLR)。本文我们探索了现代VLM在零样本设置下执行ISLR的能力。我们在WLASL300基准测试上评估了多个开源和专有VLM。我们的实验表明,在仅使用提示的零样本推理下,当前的开源VLM在经典监督ISLR分类器之下以巨大的差距表现。然而,后续实验揭示了这些模型在手势与文本描述之间捕获了部分视觉-语义对齐。更大的专有模型实现了显著更高的准确率,这凸显了模型规模和训练数据多样性的重要性。我们的所有代码都已在GitHub上公开。
引用
@article{arxiv.2604.11225,
title = {Sign Language Recognition in the Age of LLMs},
author = {Vaclav Javorek and Jakub Honzik and Ivan Gruber and Tomas Zelezny and Marek Hruz},
journal= {arXiv preprint arXiv:2604.11225},
year = {2026}
}
备注
Accepted at the CVPR 2026 Workshop on Multimodal Sign Language Research (MSLR), 8 pages, 3 figures