基于人体关键点估计的神经手语翻译
计算机视觉与模式识别
2019-06-24 v2
摘要
我们提出一种基于人体关键点估计的手语翻译系统。众所周知,计算机视觉领域的许多问题需要海量数据集来训练深度神经网络模型。在手语翻译问题上情况更甚,因为收集高质量训练数据要困难得多。本文中,我们介绍 KETI(Korea Electronics Technology Institute 的缩写)手语数据集,其包含 14,672 段高分辨率高质量视频。考虑到各国拥有不同且独特的手语,KETI 手语数据集可作为进一步研究韩文手语翻译的起点。利用 KETI 手语数据集,我们开发了一种神经网络模型,通过利用从面部、手部和身体部位提取的人体关键点,将手语视频翻译为自然语言句子。所获取的人体关键点向量由关键点的均值与标准差归一化,并用作我们基于序列到序列架构的翻译模型的输入。结果表明,即便训练数据规模不足,我们的方法依然稳健。我们的翻译模型在可用于紧急情况的 105 个句子上,于验证集(测试集)取得了 93.28%(55.28%)的翻译准确率。我们基于不同注意力机制,按衡量翻译性能的经典指标比较了若干类型的神经手语翻译模型。
引用
@article{arxiv.1811.11436,
title = {Neural Sign Language Translation based on Human Keypoint Estimation},
author = {Sang-Ki Ko and Chang Jo Kim and Hyedong Jung and Choongsang Cho},
journal= {arXiv preprint arXiv:1811.11436},
year = {2019}
}
备注
18 pages, 5 figures