中文

基于Transformer的视线估计

计算机视觉与模式识别 2021-06-01 v1

摘要

近期工作已证明transformers在许多计算机视觉任务中的有效性。然而,transformers在视线估计中的性能仍未被探索。本文中,我们采用transformers并评估其在视线估计中的有效性。我们考虑两种视觉transformer形式,即纯transformer与混合transformer。我们首先遵循流行的ViT,采用纯transformer从图像估计视线。另一方面,我们保留卷积层并整合CNN与transformers。transformer作为补充CNN的组件。我们比较两种transformer在视线估计中的性能。混合transformer以更少参数在所有评估数据集中显著优于纯transformer。我们进一步开展实验评估混合transformer的有效性并探究自注意力机制的优势。实验表明混合transformer经预训练可在所有基准上取得最先进(state-of-the-art)性能。为促进进一步研究,我们在 https://github.com/yihuacheng/GazeTR 发布代码与模型。

关键词

引用

@article{arxiv.2105.14424,
  title  = {Gaze Estimation using Transformer},
  author = {Yihua Cheng and Feng Lu},
  journal= {arXiv preprint arXiv:2105.14424},
  year   = {2021}
}