OpenHands:基于姿态预训练模型实现跨手语识别的可及性
计算与语言
2021-10-13 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
自然语言的人工智能技术近来取得了巨大进展。然而,在手语方面,尤其是将手势识别为单词或完整句子方面,尚未取得相应的进展。我们介绍了 OpenHands,这是一个库,我们将 NLP 社区针对低资源语言的四个关键思想应用于手语的单词级识别。首先,我们提出使用通过预训练模型提取的姿态作为标准数据模态,以减少训练时间并实现高效推理,并发布了针对 6 种不同手语——美国手语、阿根廷手语、中国手语、希腊手语、印度手语和土耳其手语——的标准化姿态数据集。其次,我们在全部 6 种语言上训练并发布了 4 个基于姿态的孤立手语识别模型的检查点,为部署提供基线和即用检查点。第三,为解决标注数据缺乏的问题,我们提出在无标注数据上进行自监督预训练。我们整理并发布了最大的基于姿态的印度手语(Indian-SL)预训练数据集。第四,我们比较了不同的预训练策略,并首次通过证明(a)微调性能的提升尤其在低资源环境下显著,以及(b)从 Indian-SL 到其他少数手语的高跨语言迁移,确立了预训练对手语识别的有效性。我们在 OpenHands 中开源了所有模型和数据集,希望能使手语研究更加可及,代码见 https://github.com/AI4Bharat/OpenHands。
引用
@article{arxiv.2110.05877,
title = {OpenHands: Making Sign Language Recognition Accessible with Pose-based Pretrained Models across Languages},
author = {Prem Selvaraj and Gokul NC and Pratyush Kumar and Mitesh Khapra},
journal= {arXiv preprint arXiv:2110.05877},
year = {2021}
}
备注
Submitted to AAAI22, 13 pages, 9 figures, 6 tables