InCrowdFormer:基于自我中心视角的地面行人世界模型
计算机视觉与模式识别
2023-03-17 v1
摘要
我们提出了一种地面行人世界模型,该计算模型能够预测人群中行人围绕观察者在地面平面上的移动方式,且仅利用观察者的自我中心视角。我们的模型InCrowdFormer充分借助Transformer架构,通过注意力机制建模行人交互以及从自我中心到俯视视角的转换,并采用编码器-解码器架构自回归地预测可变数量行人的地面位置。我们将未知行人身高带来的不确定性编码为潜变量,以预测行人位置的后验分布。我们在一个真实运动的新预测基准上验证了InCrowdFormer的有效性。结果表明,InCrowdFormer能准确预测行人的未来坐标。据我们所知,InCrowdFormer是此类首个行人世界模型,我们相信它将惠及包括人群导航、跟踪与合成在内的广泛自我中心视角应用。
引用
@article{arxiv.2303.09534,
title = {InCrowdFormer: On-Ground Pedestrian World Model From Egocentric Views},
author = {Mai Nishimura and Shohei Nobuhara and Ko Nishino},
journal= {arXiv preprint arXiv:2303.09534},
year = {2023}
}