Gesture2Text:基于轨迹粗糙离散化和预训练的 XR 单词-手势键盘通用解码器
计算机视觉与模式识别
2024-10-25 v1 人工智能
计算与语言
图形学
机器学习
摘要
使用单词-手势键盘(WGK)进行文本输入正在成为增强现实(XR)中一种流行的方法和关键交互方式。然而,交互模式的多样性、键盘尺寸以及这些环境中视觉反馈的差异,导致单词-手势轨迹数据呈现出不同的模式,从而增加了将轨迹解码为文本的复杂性。模板匹配解码方法(如 SHARK^2)因易于实现和配置而常用于这些 WGK 系统。然而,这些方法对噪声轨迹的解码不够准确。虽然已提出基于常规神经网络的解码器(神经解码器)用于训练单词-手势轨迹数据以提高准确性,但它们也存在局限性:需要大量训练数据以及深度学习实现 expertise。为解决这些挑战,我们提出了一种将易于实现与高解码准确性结合的新方案:一种通过在大规模粗糙离散化的单词-手势轨迹上进行预训练而实现的通用神经解码器。该方法产生一个可即用且在 AR 和 VR 中的中空中和触表面 WGK 系统之间具有通用性的 WGK 解码器,这一点通过在四个多样化数据集上实现 90.4% 的稳健平均 Top-4 准确率得以证明。它相较于 SHARK^2 提升了 37.2%,并在常规神经解码器上超过了 7.4%。此外,经过量化后的预训练神经解码器仅需 4 MB,仍不牺牲准确性,能够实时运行,在 Quest 3 上仅需 97 毫秒即可完成执行。
引用
@article{arxiv.2410.18099,
title = {Gesture2Text: A Generalizable Decoder for Word-Gesture Keyboards in XR Through Trajectory Coarse Discretization and Pre-training},
author = {Junxiao Shen and Khadija Khaldi and Enmin Zhou and Hemant Bhaskar Surale and Amy Karlson},
journal= {arXiv preprint arXiv:2410.18099},
year = {2024}
}