GazeFormer-MoE:基于 CLIP 和 MoE Transformer 的上下文感知视线估计
计算机视觉与模式识别
2026-01-21 v1 人工智能
摘要
我们提出了一种语义调制的多尺度 Transformer,用于三维视线估计。我们的模型利用可学习的原型库(光照、头部姿态、背景、方向)来条件化 CLIP 全局特征,将这些富含原型信息的全局向量与 CLIP 图像块令牌和高分辨率 CNN 令牌融合在一个统一的注意力空间中,并用路由/共享的混合专家 (Mixture of Experts) 替换多个 FFN 模块,以增加条件容量。在 MPIIFaceGaze、EYEDIAP、Gaze360 和 ETH-XGaze 数据集上的评估结果显示,我们的模型取得了新的最优角度误差,分别为 2.49{\deg}、3.22{\deg}、10.16{\deg} 和 1.44{\deg},相比先前报道的结果,相对提升高达 64%。消融实验将性能提升归因于原型条件化、跨尺度融合、混合专家和超参数。我们的代码已公开于 https://github.com/AIPMLab/Gazeformer。
引用
@article{arxiv.2601.12316,
title = {GazeFormer-MoE: Context-Aware Gaze Estimation via CLIP and MoE Transformer},
author = {Xinyuan Zhao and Xianrui Chen and Ahmad Chaddad},
journal= {arXiv preprint arXiv:2601.12316},
year = {2026}
}
备注
accepted at ICASSP 2026