一种用于多人时序视线跟随与社交视线预测的新框架
计算机视觉与模式识别
2024-03-18 v1
摘要
视线跟随与社交视线预测是揭示人类交流行为、意图和社交互动的基础任务。以往大多数方法分别处理这些任务,要么设计高度专业化的社交视线模型而无法泛化到其他社交视线任务,要么将社交视线推断视为视线跟随任务的临时后处理步骤。此外,绝大多数视线跟随方法提出了静态模型,一次只能处理一个人,因此未能利用社交互动和时序动态。在本文中,我们解决了这些局限性,并引入了一个新框架,以联合预测场景中所有人的视线目标与社交视线标签。该框架包含: 一个基于 Transformer 的时序架构,除了图像 token 外,还处理捕获与每个个体相关视线信息的特定人物 token; 一个新数据集 VSGaze,统一了多个视线跟随与社交视线数据集间的标注类型。我们展示了在 VSGaze 上训练的模型能够联合处理所有任务,并在多人视线跟随与社交视线预测上取得了 state-of-the-art 的结果。
关键词
引用
@article{arxiv.2403.10511,
title = {A Novel Framework for Multi-Person Temporal Gaze Following and Social Gaze Prediction},
author = {Anshul Gupta and Samy Tafasca and Arya Farkhondeh and Pierre Vuillecard and Jean-Marc Odobez},
journal= {arXiv preprint arXiv:2403.10511},
year = {2024}
}