基于视线跟随的视频中人与物体交互预测
计算机视觉与模式识别
2023-06-07 v1
摘要
从视频中理解人与物体的交互(HOIs)对于全面理解视觉场景至关重要。该研究方向已通过从图像以及近期的视频中检测HOIs得到解决。然而,第三人称视角下基于视频的HOI预期任务仍研究不足。本文中,我们设计了一个框架来检测视频中的当前HOIs并预期未来的HOIs。我们提出利用人类视线信息,因为人们在与物体交互前通常会注视该物体。这些视线特征与场景上下文以及人-物对的视觉外观通过时空Transformer(spatio-temporal transformer)进行融合。为了在多人场景下的HOI预期任务中评估模型,我们提出了一组逐人的多标签指标。我们的模型在VidHOI数据集上训练和验证,该数据集包含捕捉日常生活的视频,是目前最大的视频HOI数据集。HOI检测任务的实验结果表明,我们的方法相对基线提升了36.3%的大幅度。此外,我们进行了广泛的消融研究以证明我们对时空Transformer的修改和扩展的有效性。我们的代码公开于 https://github.com/nizhf/hoi-prediction-gaze-transformer。
引用
@article{arxiv.2306.03597,
title = {Human-Object Interaction Prediction in Videos through Gaze Following},
author = {Zhifan Ni and Esteve Valls Mascaró and Hyemin Ahn and Dongheui Lee},
journal= {arXiv preprint arXiv:2306.03597},
year = {2023}
}
备注
Accepted by CVIU https://doi.org/10.1016/j.cviu.2023.103741