中文

对话场景下的多模态视线跟随

计算机视觉与模式识别 2024-01-17 v1

摘要

视线跟随(gaze following)通过理解人类行为与场景信息来估计场景中人物的视线目标。现有方法通常分析场景图像以进行视线跟随。然而,与视觉图像相比,音频也为判定人类行为提供了关键线索。这表明我们可以结合音频线索进一步改进视线跟随。本文中,我们探索对话场景下的视线跟随任务。基于我们的观察“听众倾向于关注说话者”,我们提出了一种新颖的多模态视线跟随框架。我们首先利用音频与嘴唇之间的相关性,对场景中的说话者与听众进行分类。随后利用身份 information 增强场景图像,并提出一种视线候选估计网络。该网络从增强后的场景图像中估计视线候选,并使用 MLP 将主体与候选进行匹配,作为分类任务。现有视线跟随数据集侧重于视觉图像而忽略音频。为评估我们的方法,我们收集了一个对话数据集 VideoGazeSpeech (VGS),这是首个包含图像与音频的视线跟随数据集。我们的方法在 VGS 数据集上显著优于现有方法。可视化结果也证明了音频线索在视线跟随任务中的优势。我们的工作将启发更多关于多模态视线跟随估计的研究。

关键词

引用

@article{arxiv.2311.05669,
  title  = {Multi-Modal Gaze Following in Conversational Scenarios},
  author = {Yuqi Hou and Zhongqun Zhang and Nora Horanyi and Jaewon Moon and Yihua Cheng and Hyung Jin Chang},
  journal= {arXiv preprint arXiv:2311.05669},
  year   = {2024}
}