GA3CE:基于注视感知3D上下文编码的无约束3D注视估计
计算机视觉与模式识别
2025-05-19 v1
摘要
我们提出了一种新颖的3D注视估计方法,通过学习主体与场景中物体之间的空间关系,输出3D注视方向。该方法针对的是无约束场景,包括主体眼部近景不可见的情况,如主体距离较远或正面背向等情况。以往方法通常仅依赖2D外观,或在不可学习的后处理步骤中仅利用深度图 incorporation limited spatial cues。从2D观察估计3D注视方向在这些场景下具有挑战性;由于主体姿态、场景布局和注视方向的变化,结合不同的摄像机姿态,即便针对相同的3D场景,也会导致多样化的2D外观和3D注视方向。为此,我们提出GA3CE:Gaze-Aware 3D Context Encoding。该方法将主体与场景表示为3D姿态和物体位置,将其作为3D上下文来学习3D空间中的空间关系。受人类视觉启发,我们在仰视坐标系中对该上下文进行对齐,显著降低了空间复杂度。此外,我们提出D(direction-distance-decomposed)位置编码,以更好地捕捉3D上下文与注视方向在方向和距离空间中的关系。实验表明,在单帧设置下,相较于领先的基线方法,本方法在基准数据集上将平均角度误差降低13%-37%。
引用
@article{arxiv.2505.10671,
title = {GA3CE: Unconstrained 3D Gaze Estimation with Gaze-Aware 3D Context Encoding},
author = {Yuki Kawana and Shintaro Shiba and Quan Kong and Norimasa Kobori},
journal= {arXiv preprint arXiv:2505.10671},
year = {2025}
}
备注
Accepted to CVPR2025. Project page: https://woven-visionai.github.io/ga3ce-project/