中文

学习观察者凝视:基于人类-对象交互识别的零样注意力预测

计算机视觉与模式识别 2024-05-17 v1

摘要

现有的注意力预测研究大多聚焦于显著性实例,如人类和物体。然而,源于人类观察者对实例之间交互理解所产生的更复杂的交互导向注意力,目前仍有待广泛探索。这在推动人机交互和以人类为中心的人工智能方面同样至关重要。为弥合这一差距,我们首先收集了一个名为IG的新型凝视注视数据集,包含740种多样化交互类别,共53万个凝视注视点,捕捉人类观察者在理解交互过程中的视觉注意力。随后,我们提出了基于零样本的交互导向注意力预测任务ZeroIA,该任务挑战模型预测训练期未遇到的交互的视觉线索。第三,我们构建了名为IA的交互注意力模型,旨在模拟人类观察者的认知过程以解决ZeroIA问题。大量实验表明,所提出的IA在ZeroIA和完全监督设置下均优于其他最先进方法。最后,我们尝试将交互导向注意力应用于交互识别任务本身。进一步的实验结果表明,融合来自IG的真实人类注意力数据以及由IA生成的注意力标签,能够显著提升现有最先进人机交互模型的性能和可解释性。

关键词

引用

@article{arxiv.2405.09931,
  title  = {Learning from Observer Gaze:Zero-Shot Attention Prediction Oriented by Human-Object Interaction Recognition},
  author = {Yuchen Zhou and Linkai Liu and Chao Gou},
  journal= {arXiv preprint arXiv:2405.09931},
  year   = {2024}
}

备注

Accepted by CVPR2024. Project HomePage: https://yuchen2199.github.io/Interactive-Gaze/