SignIT:意大利手语识别的全面数据集与多模态分析
计算机视觉与模式识别
2025-12-17 v1
摘要
本工作提出了 SignIT,一款用于研究意大利手语 (LIS) 识别任务的新型数据集。该数据集包含 644 个视频,时长达3.33小时。我们考虑包含 94 个不同手语类别的分类法进行手动标注,这些类别归属于五大宏观类别:动物、食物、颜色、情感与家庭。我们还提取了与用户手部、面部和身体相关的 2D 关键点。随数据集一起,我们提出了面向手语识别任务的基准测试,采用多种最新模型,探讨了时间信息、2D 关键点与 RGB 帧对这些模型性能的影响。结果表明,这些模型在这一具有挑战性的 LIS 数据集上存在局限。我们将在以下链接公开数据与标注:https://fpv-iplab.github.io/SignIT/。
引用
@article{arxiv.2512.14489,
title = {SignIT: A Comprehensive Dataset and Multimodal Analysis for Italian Sign Language Recognition},
author = {Alessia Micieli and Giovanni Maria Farinella and Francesco Ragusa},
journal= {arXiv preprint arXiv:2512.14489},
year = {2025}
}