中文

指在镜头中说遍天下:无约束真实场景空写

计算机视觉与模式识别 2024-12-30 v1 人机交互

摘要

空写是一种结合计算机视觉和自然语言处理领域的具有挑战性的任务,提供一种直观自然的人机交互方式。然而,当前的空写解决方案面临两个主要挑战:(1) 依赖于复杂传感器(如雷达、EEG 等)来捕获精确的手写轨迹,(2)缺乏覆盖全面词汇范围的基于视频的空写数据集。这些限制阻碍了在各种真实场景中的实际应用,包括在 iPhone 和笔记本电脑等设备上的使用。为解决这些挑战,我们提出了 groundbreaking air-writing 中文字符视频数据集 (AWCV-100K-UCAS2024),作为基于视频的空写基准测试的 pioneering 方案。该数据集使用常用 RGB 镜头在各种真实场景中捕获手写轨迹,无需复杂传感器。AWCV-100K-UCAS2024 包含 880 万视频帧,涵盖 GB2312-80 级别-1 字符集 (GB1) 中的全部 3755 个字符。此外,我们引入了我们的基线方法,video-based character recognizer (VCRec)。VCRec 能巧妙地从稀疏视觉线索中提取手指尖特征,并采用时空序列模块进行分析。实验结果表明,VCRec 在识别空写字符方面在定量和定性上均优于现有模型。这一突破为在真实场景中增强人机交互之路。此外,我们的 approach 利用廉价 RGB 镜头,使其在多种场景中具有适用性。代码和数据示例将在 https://github.com/wmeiqi/AWCV 上公开。

关键词

引用

@article{arxiv.2412.19537,
  title  = {Finger in Camera Speaks Everything: Unconstrained Air-Writing for Real-World},
  author = {Meiqi Wu and Kaiqi Huang and Yuanqiang Cai and Shiyu Hu and Yuzhong Zhao and Weiqiang Wang},
  journal= {arXiv preprint arXiv:2412.19537},
  year   = {2024}
}