中文

GazeMoE:基于混合专家的注视目标感知

计算机视觉与模式识别 2026-03-09 v1 人工智能

摘要

从可见图像中估计人类注视目标是机器人理解人类注意力的关键任务,但仍然面临通用神经网络架构和训练范式的开发挑战。虽然近期在预训练视觉基础模型方面的进展为定位注视目标提供了可行之路,但将多模态线索——包括眼部、头部姿态、手势和上下文特征——整合到模型中,仍需具有适应性且高效的解码机制。以混合专家 (MoE) 为灵感,用于大型视觉语言模型中的自适应领域专长,我们提出 GazeMoE,一种新的端到端框架,通过 MoE 模块有选择地从冻结的基础模型中利用与注视目标相关的线索。为解决注视目标分类 (帧内 vs. 帧外) 中的类别不平衡问题并增强鲁棒性,GazeMoE 引入了类别平衡辅助损失,并结合了战略数据增强,包括区域特定裁切和光谱变换。大量基准数据集上的实验表明,我们的 GazeMoE 实现了最先进的性能,在具有挑战性的注视估计任务中超越了现有方法。代码和预训练模型已发布于 https://huggingface.co/zdai257/GazeMoE。

关键词

引用

@article{arxiv.2603.06256,
  title  = {GazeMoE: Perception of Gaze Target with Mixture-of-Experts},
  author = {Zhuangzhuang Dai and Zhongxi Lu and Vincent G. Zakka and Luis J. Manso and Jose M Alcaraz Calero and Chen Li},
  journal= {arXiv preprint arXiv:2603.06256},
  year   = {2026}
}

备注

8 pages, 3 figures, ICRA 2026