中文

基于 Transformer 的 RGBD 视线追踪

计算机视觉与模式识别 2025-10-09 v1 人工智能

摘要

本论文的主题是实现一个基于人工智能的视线追踪系统,使用包含颜色(RGB)和深度(D)信息的 RGBD 图像。为融合从这些图像中提取的特征,采用基于 Transformer 架构的模块。选择将 RGBD 输入图像与 Transformer 组合的原因是尚未有研究对其进行探索。此外,本文创建了一个新的数据集用于训练 AI 模型,因为现有数据集要么不包含深度信息,要么只包含不适用于视线角度估计任务的视线点估计标签。在三个不同的数据集上训练、验证和评估了各种模型配置。训练好的模型将用于实时管道,以估计人的视线方向,从而估计其面对计算机屏幕时的视线点。本论文中使用的 AI 模型架构基于 Lian 等人的早期工作。它使用生成对抗网络(GAN)同时去除深度图中的伪影并提取头部姿态特征。Lian 等人在自己的数据集 ShanghaiTechGaze+ 上实现了均值为 38.7mm 的平均欧几里得误差。在本论文中,采用包含 Transformer 模块进行特征融合的模型架构在同一数据集上实现了均值为 55.3mm 的平均欧几里得误差,但我们表明不使用预训练的 GAN 模块可实现均值为 30.1mm 的平均误差。用多层感知机(MLP)取代 Transformer 模块可将误差提高到 26.9mm。这些结果在其他两个数据集上也表现出一致性。在 ETH-XGaze 数据集上,采用 Transformer 模块的模型实现了均值为 3.59° 的平均角度误差,而不使用 Transformer 模块则为 3.26°,而数据集作者 Zhang 等人使用的根本不同的数据集架构实现了均值为 2.04° 的平均角度误差。在 OTH-Gaze-Estimation 数据集上...

关键词

引用

@article{arxiv.2510.06298,
  title  = {RGBD Gaze Tracking Using Transformer for Feature Fusion},
  author = {Tobias J. Bauer},
  journal= {arXiv preprint arXiv:2510.06298},
  year   = {2025}
}

备注

Master Thesis with 125 pages, 59 figures, 17 tables