空中书写:基于时空卷积的手指运动无约束文本识别
计算机视觉与模式识别
2021-04-20 v1
摘要
本文针对具有挑战性的空中书写(WiTA)任务——一项连接视觉与自然语言处理(NLP)的精细任务——引入了一个新的基准数据集。WiTA 通过手指运动实现直观自然的书写方法,用于人机交互(HCI)。我们的 WiTA 数据集将促进数据驱动的 WiTA 系统的发展,此类系统迄今因缺乏数据集以及所采用的传统统计模型而表现不佳。我们的数据集包含两种语言(韩语和英语)的五个子数据集,来自 122 名参与者共计 209,926 个视频实例。我们使用 RGB 相机捕捉 WiTA 的手指运动,以确保广泛的可用性与成本效益。接下来,我们提出受 3D ResNet 启发的时空残差网络架构。这些模型从手指运动中执行无约束文本识别,分别以每秒 435 和 697 解码帧的处理速度保证实时运行(韩语和英语),并将作为评估标准。我们的数据集与源代码发布于 https://github.com/Uehwan/WiTA。
引用
@article{arxiv.2104.09021,
title = {Writing in The Air: Unconstrained Text Recognition from Finger Movement Using Spatio-Temporal Convolution},
author = {Ue-Hwan Kim and Yewon Hwang and Sun-Kyung Lee and Jong-Hwan Kim},
journal= {arXiv preprint arXiv:2104.09021},
year = {2021}
}
备注
10 pages, 6 figures, 6 tables