中文

利用多缩放尺度在真实场景中实现360度视线估计

计算机视觉与模式识别 2021-10-27 v3

摘要

视线估计旨在预测图像或视频中人物正在注视的位置。从技术上讲,视线信息可从两种不同的放大层级推断:面部朝向与眼部朝向。在真实场景下的视线估计中,由于极端左/右注视或遮挡等情况下缺乏清晰的眼斑,该推断并非总可行。本工作中,我们设计了一种模型,模仿人类通过聚合聚焦注视(每次针对面部区域的不同放大层级)来估计视线的能力。该模型避免了提取清晰眼斑的需要,同时解决了真实场景下视线估计中另一重要的面部尺度变化问题。我们进一步扩展该模型,通过以极坐标表示编码后向视线并采用鲁棒平均方案,来处理360度视线估计这一挑战性任务。在不含尺度变化面部的ETH-XGaze数据集上的实验结果表明,该模型能有效同化多尺度信息。对于其他具有大量尺度变化面部的基准数据集(Gaze360与RT-GENE),所提模型在使用图像或视频时均达到了视线估计的SOTA性能。我们的代码与预训练模型可在 https://github.com/ashesh-0/MultiZoomGaze 获取。

关键词

引用

@article{arxiv.2009.06924,
  title  = {360-Degree Gaze Estimation in the Wild Using Multiple Zoom Scales},
  author = {Ashesh and Chu-Song Chen and Hsuan-Tien Lin},
  journal= {arXiv preprint arXiv:2009.06924},
  year   = {2021}
}

备注

accepted at BMVC 2021