基于可穿戴相机与多模态融合的自我中心人体轨迹预测
计算机视觉与模式识别
2022-07-08 v3
摘要
在本文中,我们解决了在拥挤空间中预测自我中心相机佩戴者(自我人)轨迹的问题。从不同相机佩戴者在真实世界中行走的数据中学习到的轨迹预测能力,可以迁移用于辅助视障人士导航,以及向移动机器人灌输人类导航行为,从而实现更好的人机交互。为此,我们构建了一个新颖的自我中心人体轨迹预测数据集,包含人们在拥挤空间中佩戴相机导航的真实轨迹,以及提取的丰富上下文数据。我们提取并利用三种不同模态来预测相机佩戴者的轨迹,即其过去轨迹、附近人员的过去轨迹以及环境(如场景语义或场景深度)。我们设计了一个基于Transformer的编码器-解码器神经网络模型,集成了一种新颖的级联交叉注意力机制来融合多种模态,用于预测相机佩戴者的未来轨迹。我们进行了大量实验,结果表明我们的模型在自我中心人体轨迹预测方面优于现有最先进方法。
引用
@article{arxiv.2111.00993,
title = {Egocentric Human Trajectory Forecasting with a Wearable Camera and Multi-Modal Fusion},
author = {Jianing Qiu and Lipeng Chen and Xiao Gu and Frank P. -W. Lo and Ya-Yen Tsai and Jiankai Sun and Jiaqi Liu and Benny Lo},
journal= {arXiv preprint arXiv:2111.00993},
year = {2022}
}