句子级手语识别框架
计算机视觉与模式识别
2022-11-29 v1 人工智能
机器学习
摘要
我们提出句子级手语识别(SLR)的两种方案。句子级SLR需要将手语句子的视频映射为词素标签序列。连接主义时序分类(CTC)已被用作两个模型的分类器层级。CTC用于避免将句子预分割为单个词。第一个模型是基于LRCN的模型,第二个模型是多线索网络(Multi-Cue Network)。LRCN是一种模型,其中CNN作为特征提取器应用于每帧后再输入LSTM。在第一种方法中,未利用先验知识。原始帧被输入带有顶层CTC的18层LRCN。在第二种方法中,与使用Mediapipe提取的与每个手势相关的三个主要特征(手形、手位置和手部运动信息)被提取。手形的2D关键点用于创建手部骨架,然后输入CONV-LSTM模型。手部位置和作为相对头部距离的手位置被输入独立的LSTM。所有三个信息源随后被集成到带有CTC分类层的多线索网络中。我们在RWTH-PHOENIX-Weather上评估了所提模型的性能。在对模型超参数(如特征图数量、输入尺寸、批大小、序列长度、LSTM记忆单元、正则化和丢弃率)进行大量搜索后,我们取得了35的词错误率(WER)。
引用
@article{arxiv.2211.14447,
title = {Sentence-Level Sign Language Recognition Framework},
author = {Atra Akandeh},
journal= {arXiv preprint arXiv:2211.14447},
year = {2022}
}