中文

EFE:端到端帧到注视估计

计算机视觉与模式识别 2023-05-10 v1

摘要

尽管基于学习的注视估计方法近期有所发展,大多数方法仍需要一个或多个眼睛或面部区域裁剪作为输入,并输出一个注视方向向量。裁剪可提高眼睛区域的分辨率,并减少服装和头发等混杂因素,被认为有利于最终模型性能。然而,这种眼睛/面部块裁剪过程代价高、易出错,且针对不同方法的具体实现各异。在本文中,我们提出一种帧到注视网络,可直接从相机原始帧预测 3D 注视原点和 3D 注视方向,无需任何面部或眼睛裁剪。我们的方法证明,尽管眼睛区域像素极少带来挑战,仍可从原始下采样帧(从 FHD/HD 到 VGA/HVGA 分辨率)直接回归注视。所提方法在 GazeCapture、MPIIFaceGaze 和 EVE 三个公开注视数据集上取得了与最先进方法相当的注视点(PoG)估计结果,并对极端相机视角变化具有良好的泛化能力。

关键词

引用

@article{arxiv.2305.05526,
  title  = {EFE: End-to-end Frame-to-Gaze Estimation},
  author = {Haldun Balim and Seonwook Park and Xi Wang and Xucong Zhang and Otmar Hilliges},
  journal= {arXiv preprint arXiv:2305.05526},
  year   = {2023}
}