中文

用于注视目标预测的模块化多模态架构:在隐私敏感场景中的应用

计算机视觉与模式识别 2023-07-12 v1

摘要

预测一个人的注视位置是一项复杂任务,不仅需要理解该人的目光与场景内容,还需理解3D场景结构及该人的情境(他们是在操作?与他人交互还是观察他人?专注?)以检测视线中的遮挡,或应用人类在观察他人时典型的注意先验。在本文中,我们假设通过利用显式导出的多模态线索(如深度和姿态)来识别并利用此类先验可更好地实现。因此我们提出一种模块化多模态架构,允许使用注意机制组合这些线索。该架构可自然用于隐私敏感情境(如监控与健康),其中个人可识别信息不能被发布。我们在GazeFollow和VideoAttentionTarget公开数据集上进行了大量实验,取得了最先进的性能,并证明了在隐私设置情形下极具竞争力的结果。

关键词

引用

@article{arxiv.2307.05158,
  title  = {A Modular Multimodal Architecture for Gaze Target Prediction: Application to Privacy-Sensitive Settings},
  author = {Anshul Gupta and Samy Tafasca and Jean-Marc Odobez},
  journal= {arXiv preprint arXiv:2307.05158},
  year   = {2023}
}

备注

In the proceedings of the GAZE workshop at CVPR 2022