中文

基于混合域自适应表征学习的注视姿态估计

计算机视觉与模式识别 2025-11-18 v1

摘要

基于外观的注视姿态估计旨在从单张面部图像预测精确的3D注视方向,近年来取得了显著进展。然而,大多数方法在跨域评估时会因表达式、可穿戴设备和图像质量等与注视无关的因素而出现显著性能下降。为缓解此问题,我们提出一种新颖的混合域自适应表征学习(HARL)框架,利用多源混合数据集学习鲁棒的注视表征。具体而言,我们提出通过以无监督域适应方式对齐从高质量近眼图像中提取的特征,来从低质量面部图像中解耦出与注视相关的表征,这几乎不需要额外的计算或推理成本。此外,我们分析头姿态的影响,设计一种简单而高效的稀疏图融合模块,以探索注视方向与头姿态之间的几何约束,实现稠密且稳健的注视表征。在EyeDiap、MPIIFaceGaze和Gaze360数据集上进行大规模实验,表明本方法分别实现了5.02°、3.36°和9.26°的国际最先进精度,并在跨数据集评估中呈现出具竞争力的性能。代码已公开 https://github.com/da60266/HARL。

关键词

引用

@article{arxiv.2511.13222,
  title  = {Hybrid-Domain Adaptative Representation Learning for Gaze Estimation},
  author = {Qida Tan and Hongyu Yang and Wenchao Du},
  journal= {arXiv preprint arXiv:2511.13222},
  year   = {2025}
}

备注

AAAI2026