基于视频的无词典手指拼写识别:数据、模型与说话人自适应
计算与语言
2016-09-27 v1 计算机视觉与模式识别
摘要
我们研究识别美国手语 (ASL) 中手指拼写字母视频序列的问题。手指拼写是 ASL 中重要但相对较少被研究的部分。由于诸多原因,识别手指拼写具有挑战性:它涉及快速、微小的动作,且通常高度协同发音;它在不同手语者之间表现出显著差异;且缺乏收集到的连续手指拼写数据。在本工作中,我们收集并标注了一个新的连续手指拼写视频数据集,比较了几种类型的识别器,并探讨了手语者差异问题。我们表现最佳的模型是使用基于深度神经网络特征的分段(半马尔可夫)条件随机场。在手语者相关设定下,我们的识别器实现了高达约 92% 的字母准确率。多手语者设定更具挑战性,但通过神经网络自适应,我们在该设定下实现了高达 83% 的字母准确率。
引用
@article{arxiv.1609.07876,
title = {Lexicon-Free Fingerspelling Recognition from Video: Data, Models, and Signer Adaptation},
author = {Taehwan Kim and Jonathan Keane and Weiran Wang and Hao Tang and Jason Riggle and Gregory Shakhnarovich and Diane Brentari and Karen Livescu},
journal= {arXiv preprint arXiv:1609.07876},
year = {2016}
}
备注
arXiv admin note: substantial text overlap with arXiv:1608.08339