利用对数几率:手语识别与拼写纠正联合方法
计算机视觉与模式识别
2020-07-02 v1 机器学习
摘要
机器学习技术在图像自动语义分析方面表现出色,在具有挑战性的基准上达到了人类水平的性能。然而,由于输入数据的维度显著更高,以及标注训练样本的需求显著更大,视频的语义分析仍然具有挑战性。通过研究德语手语视频的自动识别,我们证明了在相对稀缺的 2800 个视频训练数据上,现代视频分析深度学习架构(如 ResNeXt)结合大规模手势识别任务的迁移学习,可以实现约 75% 的字符准确率。考虑到这意味着一个 5 字母单词被正确拼写的概率低于 25%,拼写纠正系统对于生成可读输出至关重要。本文的贡献是提出一种卷积神经网络用于拼写纠正,该网络以字符识别网络的 softmax 输出(而非拼写错误的单词)作为输入。我们证明,纯粹在 softmax 输入上学习并结合稀缺训练数据会导致过拟合,因为网络将输入死记硬背。相反,在网络上使用分类输出的对数几率(logits)的若干变体进行训练,即按常数因子缩放、添加随机噪声、混合 softmax 与 hardmax 输入或纯粹在 hardmax 输入上训练,可带来更好的泛化能力,同时受益于这些输出中隐藏的重要信息(其 top-5 准确率为 98%),从而在字符准确率相对较低的情况下产生可读文本。
引用
@article{arxiv.2007.00603,
title = {Exploiting the Logits: Joint Sign Language Recognition and Spell-Correction},
author = {Christina Runkel and Stefan Dorenkamp and Hartmut Bauermeister and Michael Moeller},
journal= {arXiv preprint arXiv:2007.00603},
year = {2020}
}
备注
First two authors contributed equally. Accepted at ICPR 2020