中文

合并多数据集以改进基于外观的视线估计

计算机视觉与模式识别 2024-09-04 v1

摘要

已有多个数据集被创建用于训练和测试基于外观的视线估计器。直观上,更多数据应带来更好的性能。然而,合并数据集来训练单个估计器很少能提升视线估计性能。一个原因可能是获取视线样本所采用的实验协议存在差异,导致头部姿态、视线角度、光照等分布不同。另一个原因可能是用于定义视线角度的方法不一致(标签不匹配)。我们提出两项创新,通过利用多个数据集来提升视线估计性能:一是改变估计器架构,二是引入视线自适应模块。大多数最先进的估计器要么并行地融合从双眼和整个面部图像中提取的信息,要么先融合双眼信息再与面部信息结合。我们提出的两阶段基于 Transformer 的视线特征融合 (TTGF) 方法,使用 Transformer 分别融合每只眼睛和面部的信息,然后再融合双眼的信息。我们认为这提高了对头部姿态的不变性,因为头部姿态的变化以不同方式影响左右眼图像。我们提出的视线适配模块 (GAM) 方法通过为每个数据集应用一个视线适配模块来校正来自单个共享估计器的视线估计,从而处理标注不一致问题。这使我们能够跨数据集合并信息,尽管标注存在差异。我们的实验表明,这些创新单独和共同地(提升 10% - 20%)均能超越 SOTA 的视线估计性能。我们的代码可在 https://github.com/HKUST-NISL/GazeSetMerge 获取。

关键词

引用

@article{arxiv.2409.00912,
  title  = {Merging Multiple Datasets for Improved Appearance-Based Gaze Estimation},
  author = {Liang Wu and Bertram E. Shi},
  journal= {arXiv preprint arXiv:2409.00912},
  year   = {2024}
}

备注

14 pages