中文

基于新视角合成与特征解耦的域自适应全脸凝视估计

计算机视觉与模式识别 2024-07-09 v2

摘要

随着深度神经网络的近期发展,基于表观的凝视估计在同域训练与测试下已取得显著成功。与同域任务相比,不同域间的差异导致跨域性能严重下降,阻碍了凝视估计在真实世界应用中的部署。在所有因素中,头部姿态与凝视的范围被认为对凝视估计的最终性能有重要作用,而收集大范围数据成本高昂。本工作提出一种由训练数据合成与凝视估计模型组成的有效模型训练流程,用于无监督域自适应。所提数据合成利用单图像三维重建扩展源域的头部姿态范围,无需三维面部形状数据集。为弥合合成与真实图像间不可避免的鸿沟,我们进一步提出一种适用于合成全脸数据的无监督域自适应方法。我们提出一种解耦自编码器网络以分离凝视相关特征,并引入背景增强一致性损失以利用合成源域的特性。通过综合实验表明,仅使用我们的合成训练数据的模型性能可与扩展了大标签范围的真实数据相媲美。我们所提的域自适应方法进一步提升了在多个目标域上的性能。代码与数据将发布于 https://github.com/ut-vision/AdaptiveGaze。

关键词

引用

@article{arxiv.2305.16140,
  title  = {Domain-Adaptive Full-Face Gaze Estimation via Novel-View-Synthesis and Feature Disentanglement},
  author = {Jiawei Qin and Takuru Shimoyama and Xucong Zhang and Yusuke Sugano},
  journal= {arXiv preprint arXiv:2305.16140},
  year   = {2024}
}

备注

Submitted to Computer Vision and Image Understanding (CVIU)