中文

DMAGaze:基于特征解�合与多尺度注意力的注视估计

计算机视觉与模式识别 2025-05-27 v2 人工智能

摘要

注视估计预测注视方向,常面临来自面部图像中复杂注视无关信息的干扰。在本工作中,我们提出一种新型注视估计框架 DMAGaze,通过三个方面利用面部图像信息:(1)解�合自面部图像的注视相关全局特征,(2)从裁剪后的眼部局部提取眼部特征,(3)头部姿态估计特征,以提升整体性能。首先,我们设计一种基于连续掩码的新型解�合器,通过分别重构眼部和非眼部区域,实现注视相关与注视无关信息的双分支解�合目标。此外,我们引入一种新的级联注意力模块,称为多尺度全局局部注意力模块 (MS-GLAM)。通过定制化的级联注意力结构,它有效地在多个尺度上聚焦全局和局部信息,进一步增强来自解�合器的特征。最后,由上部面部分支解�合的全局注视相关特征,结合头部姿态和局部眼部特征,通过检测头实现高精度注视估计。我们对 DMAGaze 进行了广泛的在两个主流公开数据集上的验证,实现了最先进的性能。

关键词

引用

@article{arxiv.2504.11160,
  title  = {DMAGaze: Gaze Estimation Based on Feature Disentanglement and Multi-Scale Attention},
  author = {Haohan Chen and Hongjia Liu and Shiyong Lan and Wenwu Wang and Yixin Qiao and Yao Li and Guonan Deng},
  journal= {arXiv preprint arXiv:2504.11160},
  year   = {2025}
}