从注视解码注意力:一个基准数据集与端到端模型
计算机视觉与模式识别
2022-11-22 v1 机器学习
摘要
眼动追踪有潜力在生态有效的环境中提供关于人类认知的丰富行为数据。然而,分析这些丰富数据通常具有挑战性。大多数自动化分析专门针对具有清晰分离、静态感兴趣区域的简单人工视觉刺激,而在复杂视觉刺激(如大多数自然场景)背景下的分析则依赖费力且耗时的手动标注。本文研究使用计算机视觉工具进行“注意力解码”,即评估被试显性视觉注意力随时间的位置这一任务。我们提供了一个公开可用的多目标眼动追踪(MOET)数据集,包含被试在拥挤真实世界视频中追踪特定对象的注视数据,并标注了标签与边界框,用于训练和评估注意力解码算法。我们还提出了两种用于注意力解码的端到端深度学习模型,并与最先进的启发式方法进行了比较。
引用
@article{arxiv.2211.10966,
title = {Decoding Attention from Gaze: A Benchmark Dataset and End-to-End Models},
author = {Karan Uppal and Jaeah Kim and Shashank Singh},
journal= {arXiv preprint arXiv:2211.10966},
year = {2022}
}
备注
To be published in Proceedings of the NeurIPS 2022 Gaze Meets ML Workshop