通过蒸馏视觉基础模型快速部署端侧眼动追踪
计算机视觉与模式识别
2026-04-06 v1
摘要
眼动追踪(ET)在增强现实和虚拟现实应用中发挥关键作用。然而,快速部署高精度、端侧注视估计以适配新产品仍然具有挑战性,因为硬件配置(如相机位置、相机姿态和光照条件)往往在设备代际之间发生变化。视觉基础模型(VFMs)是快速训练和部署的有前景方向,它们在自然图像基准上表现优异;然而我们发现现成的VFMs在专用的近眼红外图像上仍难以达到高精度。为弥补这一差距,我们提出了DistillGaze,一个通过利用有标签合成数据和无标签真实数据来蒸馏基础模型的框架,用于快速且高性能的端侧注视估计。DistillGaze分两个阶段进行。第一阶段,我们利用有标签合成图像和无标签真实图像上的自监督学习将VFM适配为领域专用教师模型。合成数据提供可扩展的高质量注视监督,而无标签真实数据有助于弥合合成到真实的领域差距。第二阶段,我们使用教师引导和自训练来训练端侧学生模型。在涵盖超过2000名参与者的大规模众包数据集上评估,DistillGaze相对于仅使用合成数据的基线将中位注视误差降低了58.62%,同时保持适合实时端侧部署的轻量级256K参数模型。总体而言,DistillGaze为训练和部署适应硬件变化的眼动追踪模型提供了高效路径,并为在端侧回归任务中结合合成监督与无标签真实数据提供了方法参考。
引用
@article{arxiv.2604.02509,
title = {Rapidly deploying on-device eye tracking by distilling visual foundation models},
author = {Cheng Jiang and Jogendra Kundu and David Colmenares and Fengting Yang and Joseph Robinson and Yatong An and Ali Behrooz},
journal= {arXiv preprint arXiv:2604.02509},
year = {2026}
}