中文

面向低资源环境的多模态外观式注视控制虚拟键盘:同步与异步交互

人机交互 2025-08-26 v1 人工智能 机器学习

摘要

过去十年间,针对具有 mobility 和言语障碍者的沟通需求需求不断增长。注视轨迹 tracking 已成为无手沟通的有前景解决方案;然而,传统的外观式界面常面临准确性问题、无控制的眼动以及命令集合复杂等挑战。本 work 提出一种多模态外观式注视控制虚拟键盘,利用深度学习结合标准摄像头硬件,集成同步与异步两种模式以实现命令选择。该虚拟键盘应用程序支持基于菜单的选择,包含9个命令,使用户可拼写和输入最多56个英文字符(包括大小写字母、标点符号及删除功能)。对该系统进行了评估,20名健康受试者完成了特定设计的输入任务,使用三种输入模式:(i)鼠标、(ii)注视轨迹仪、(iii)未修改的摄像头。以速度和信息传递速率(ITR)为指标测量了输入性能,分别在命令层面和字母层面进行评估。平均输入速度为:鼠标18.3±5.31字母/分钟、同步模式下注视轨迹仪12.60±2.99字母/分钟、同步模式下摄像头10.94±1.89字母/分钟、异步模式下注视轨迹仪11.15±2.90字母/分钟、异步模式下摄像头7.86±1.69字母/分钟。同步模式下使用摄像头的ITR约为80.29±15.72比特/分钟(命令层面)和63.56±11比特/分钟(字母层面)。该系统在摄像头输入下表现出良好的可用性和低工作负荷,凸显了以用户为中心的设计及其作为低资源环境中可访问沟通工具的前景。

关键词

引用

@article{arxiv.2508.16606,
  title  = {Multimodal Appearance based Gaze-Controlled Virtual Keyboard with Synchronous Asynchronous Interaction for Low-Resource Settings},
  author = {Yogesh Kumar Meena and Manish Salvi},
  journal= {arXiv preprint arXiv:2508.16606},
  year   = {2025}
}