中文

跨域多模态凝视目标检测

计算机视觉与模式识别 2022-08-24 v1 人工智能 人机交互

摘要

本文解决从第三人称视角捕获的单幅图像中的凝视目标检测问题。我们提出一种多模态深度架构来推断场景中人物的注视位置。该空间模型在感兴趣人物的头部图像、场景以及表示丰富上下文信息的深度图上训练。与若干先前方法不同,我们的模型不需要凝视角度的监督,不依赖头部朝向信息和/或感兴趣人物眼睛的位置。大量实验证明了我们的方法在多个基准数据集上更强的性能。我们还通过改变多模态数据的联合学习探究了方法的若干变体,其中一些变体也优于少数先前方法。本文首次考察了凝视目标检测的域适应,并赋予我们的多模态网络有效处理跨数据集域间隙的能力。所提方法的代码可在 https://github.com/francescotonini/multimodal-across-domains-gaze-target-detection 获取。

关键词

引用

@article{arxiv.2208.10822,
  title  = {Multimodal Across Domains Gaze Target Detection},
  author = {Francesco Tonini and Cigdem Beyan and Elisa Ricci},
  journal= {arXiv preprint arXiv:2208.10822},
  year   = {2022}
}

备注

Accepted to 24th ACM International Conference on Multimodal Interaction (ICMI 2022)