中文

基于人工智能会话级元校准的基于地标的网页注视跟踪

计算机视觉与模式识别 2026-03-16 v1 人机交互

摘要

实际网页注视跟踪不仅受限于误差,还受校准负担、头部运动鲁棒性和会话漂移、运行时资源占用以及浏览器使用的限制。因此,我们针对部署导向的运行点而非图像大型主干网络进行设计。我们将基于地标的注视点估计建模为会话级适应:共享的几何编码器产生的嵌入可从小型校准集中对新会话进行对齐。我们提出Equivariant Meta-Calibrated Gaze(EMC-Gaze),一种轻量级仅基于地标的方法,结合了E(3)等变地标图编码器、局部眼部几何、双眼加强、辅助3D注视方向监督以及通过episodic meta训练的闭式 ridge 校准器。为减少姿态泄漏,我们使用双视图标准化一致性损失。部署的预测器仅使用面部地标,并从简短校准中拟合每个会话的 ridge 头部模型。在距离100 cm处进行33个会话的固定样式交互式评估中,EMC-Gaze在9点校准后实现5.79±1.81度的RMSE,而Elastic Net为6.68±2.34度;在仍-head查询上,收益更大(2.92±0.75度 vs. 4.45±0.30度)。在三个主体留置测试中(每组10名主体),EMC-Gaze保持优势(5.66±0.19度 vs. 6.49±0.33度)。在MPIIFaceGaze上进行短会话校准测试中,眼部聚焦模型在16-shot校准下达到8.82±1.21度,与Elastic Net在1-shot时持平,并在从3-shot起超越其表现。导出的眼部聚焦编码器包含944,423个参数,ONNX格式下为4.76 MB,在Chromium 145中使用ONNX Runtime Web支持每个样本12.58/12.58/12.90 ms(平均/中位数/p90)进行校准后的浏览器预测。这些结果将EMC-Gaze定位为一种校准友好的运行点,而非针对更重型的基于外观的方法宣称普适最先进性能。

关键词

引用

@article{arxiv.2603.12388,
  title  = {Deployment-Oriented Session-wise Meta-Calibration for Landmark-Based Webcam Gaze Tracking},
  author = {Chenkai Zhang},
  journal= {arXiv preprint arXiv:2603.12388},
  year   = {2026}
}

备注

24 pages, 7 figures. Deployment-oriented landmark-only webcam gaze tracking with browser-capable runtime