GazeGAN——用于凝视估计的非配对对抗图像生成
计算机视觉与模式识别
2017-11-28 v1 人工智能
人机交互
摘要
近期研究表明,通过对手机前置摄像头图像进行推断,可在移动设备上估计凝视,且无需专用硬件。尽管这在人机交互、医学诊断和辅助技术(例如,将免手持凝视作为运动障碍患者的输入)等方面具有广泛潜在应用,现有方法仍受限于需从真实用户收集数据,这一过程繁琐昂贵且难以跨设备扩展。已有一些尝试使用可模拟各种头部姿态与相机设置的3D模型合成眼部区域数据,但其缺乏真实感。本文改进了近期提出的一种方法,并提出了一种生成对抗框架,以生成具有高度多样性(如受试者、头部姿态、相机设置)和真实感的大规模高分辨率彩色图像数据集,同时保留凝视标签的准确性。所提方法作用于扩展的眼部区域,甚至可补全图像缺失部分。利用该丰富的合成数据集且不使用任何来自真实用户的额外训练数据,我们展示了在移动设备上估计2D凝视位置方面优于当前最优(state-of-the-art)方法的结果。我们进一步展示了模型性能的跨设备泛化能力,以及对多样头部姿态、模糊和距离的鲁棒性提升。
引用
@article{arxiv.1711.09767,
title = {GazeGAN - Unpaired Adversarial Image Generation for Gaze Estimation},
author = {Matan Sela and Pingmei Xu and Junfeng He and Vidhya Navalpakkam and Dmitry Lagun},
journal= {arXiv preprint arXiv:1711.09767},
year = {2017}
}
备注
Project was done when the first author was at Google Research