中文

基于意图条件约束的视线引导图神经网络动作预测

计算机视觉与模式识别 2024-04-15 v1 人机交互 机器学习

摘要

人类在感知和理解视频中的意图时,利用视线来聚焦关键信息。将人类视线引入计算算法可以显著提升模型在视频理解任务中的性能。本文研究视频理解中一项具有挑战性和创新性的任务:基于部分视频预测视频中智能体的动作。我们提出了一种视线引导的动作预测算法,该算法从视频输入中构建视觉语义图。我们的方法利用图神经网络识别智能体的意图,并预测实现该意图的动作序列。为评估该方法的有效性,我们收集了一个包含在 VirtualHome 环境中生成的家庭活动数据集,并附带了观看视频时的人类视线数据。我们的方法优于 SOTA 技术,在 18 类意图识别任务中准确率提升了 7%。这凸显了我们的方法在从人类视线数据中学习重要特征方面的有效性。

关键词

引用

@article{arxiv.2404.07347,
  title  = {Gaze-Guided Graph Neural Network for Action Anticipation Conditioned on Intention},
  author = {Suleyman Ozdel and Yao Rong and Berat Mert Albaba and Yen-Ling Kuo and Xi Wang and Enkelejda Kasneci},
  journal= {arXiv preprint arXiv:2404.07347},
  year   = {2024}
}

备注

2024 Symposium on Eye Tracking Research and Applications (ETRA24), Glasgow, United Kingdom