UniGaze:通过大规模预训练迈向通用视线估计
计算机视觉与模式识别
2025-03-14 v2
摘要
尽管在数据收集和模型架构方面进行了数十年的研究,当前的视线估计模型在跨多样数据域泛化时仍面临重大挑战。自监督预训练的最新进展在各种视觉任务的跨域泛化中展现出了卓越的性能。然而,其在视线估计中的有效性仍未被探索。我们首次提出 UniGaze,通过自监督预训练利用大规模自然场景人脸数据集进行视线估计。通过系统调查,我们阐明了视线估计中有效预训练的关键因素。我们的实验表明,为语义任务设计的自监督方法在应用于视线估计时会失败,而我们精心设计的预训练流水线则能持续提升跨域性能。通过对具有挑战性的跨数据集评估以及包括留一数据集和联合数据集设置在内的新协议进行全面实验,我们证明了 UniGaze 显著提升了跨多个数据域的泛化能力,同时最大限度地减少了对昂贵标注数据的依赖。源代码和模型可在 https://github.com/ut-vision/UniGaze 获取。
引用
@article{arxiv.2502.02307,
title = {UniGaze: Towards Universal Gaze Estimation via Large-scale Pre-Training},
author = {Jiawei Qin and Xucong Zhang and Yusuke Sugano},
journal= {arXiv preprint arXiv:2502.02307},
year = {2025}
}