中文

基于外观的视线估计中网络架构与感受野的探究

计算机视觉与模式识别 2023-08-21 v1

摘要

随着过去十年深度学习技术的快速发展,基于外观的视线估计吸引了计算机视觉与人机交互研究领域的广泛关注。人们提出了具有多种机制的有趣方法,包括软注意力、硬注意力、双眼不对称、特征解耦、旋转一致性与对比学习。多数方法以单人脸或多区域作为输入,但视线估计的基础架构尚未被充分探索。本文揭示了一个事实:调整 ResNet 架构的少数简单参数,即可在三个流行数据集上超越大多数现有的视线估计任务最优方法。通过大量实验,我们得出结论:步长数、输入图像分辨率与多区域架构对视线估计性能至关重要,而其有效性依赖于输入人脸图像的质量。以 ResNet-50 为骨干网络,我们在三个数据集上取得了最优性能,ETH-XGaze 上视线估计误差为 3.64,MPIIFaceGaze 上为 4.50,Gaze360 上为 9.13 度。

关键词

引用

@article{arxiv.2308.09593,
  title  = {Investigation of Architectures and Receptive Fields for Appearance-based Gaze Estimation},
  author = {Yunhan Wang and Xiangwei Shi and Shalini De Mello and Hyung Jin Chang and Xucong Zhang},
  journal= {arXiv preprint arXiv:2308.09593},
  year   = {2023}
}