利用多缩放尺度在真实场景中实现360度视线估计
计算机视觉与模式识别
2021-10-27 v3
摘要
视线估计旨在预测图像或视频中人物正在注视的位置。从技术上讲,视线信息可从两种不同的放大层级推断:面部朝向与眼部朝向。在真实场景下的视线估计中,由于极端左/右注视或遮挡等情况下缺乏清晰的眼斑,该推断并非总可行。本工作中,我们设计了一种模型,模仿人类通过聚合聚焦注视(每次针对面部区域的不同放大层级)来估计视线的能力。该模型避免了提取清晰眼斑的需要,同时解决了真实场景下视线估计中另一重要的面部尺度变化问题。我们进一步扩展该模型,通过以极坐标表示编码后向视线并采用鲁棒平均方案,来处理360度视线估计这一挑战性任务。在不含尺度变化面部的ETH-XGaze数据集上的实验结果表明,该模型能有效同化多尺度信息。对于其他具有大量尺度变化面部的基准数据集(Gaze360与RT-GENE),所提模型在使用图像或视频时均达到了视线估计的SOTA性能。我们的代码与预训练模型可在 https://github.com/ashesh-0/MultiZoomGaze 获取。
引用
@article{arxiv.2009.06924,
title = {360-Degree Gaze Estimation in the Wild Using Multiple Zoom Scales},
author = {Ashesh and Chu-Song Chen and Hsuan-Tien Lin},
journal= {arXiv preprint arXiv:2009.06924},
year = {2021}
}
备注
accepted at BMVC 2021