基于 Transformer 的视频中人类视线行为预测模型
计算机视觉与模式识别
2024-04-15 v1 人机交互
机器学习
摘要
利用人类视线进行视频理解任务的眼动追踪应用变得越来越重要。为了有效地基于眼动追踪数据自动化视频分析过程,准确模拟人类视线行为至关重要。然而,由于人类视线模式固有的复杂性和模糊性,该任务面临重大挑战。本文提出了一种模拟人类视线行为的新方法。我们的方法使用基于 Transformer 的强化学习算法来训练一个充当人类观察者的智能体,其主要作用是观看视频并模拟人类视线行为。我们采用了从 VirtualHome 模拟器生成的视频中收集的眼动追踪数据集,主要关注活动识别。我们的实验结果通过强调其复制人类视线行为的能力及其在以真实人类视线作为输入的下游任务中的适用性,证明了我们视线预测方法的有效性。
引用
@article{arxiv.2404.07351,
title = {A Transformer-Based Model for the Prediction of Human Gaze Behavior on Videos},
author = {Suleyman Ozdel and Yao Rong and Berat Mert Albaba and Yen-Ling Kuo and Xi Wang and Enkelejda Kasneci},
journal= {arXiv preprint arXiv:2404.07351},
year = {2024}
}
备注
2024 Symposium on Eye Tracking Research and Applications (ETRA24), Glasgow, United Kingdom