从三维像素连续体重建三维语义轨迹
计算机视觉与模式识别
2017-12-06 v1
摘要
本文提出一种从同步多视频中重建三维人类交互密集语义轨迹流的方法。交互天然引入自遮挡与光照/外观/形状变化,导致高度碎片化的轨迹重建以及含噪且粗糙的语义标签。我们的猜想是,在众多视角中,存在一组视角能够有把握地识别三维轨迹的视觉语义标签。我们引入一种称为三维语义图的新表示——每个轨迹上语义标签的概率分布。我们通过基于视角池化(即寻找最能代表轨迹语义的视角)的可见性与二维识别置信度推理来构建三维语义图。利用三维语义图,我们通过估计长程轨迹间的局部刚性变换来考虑其亲和度,从而联合精确推断所有轨迹标签。该推断在预测有效性、表示鲁棒性与亲和度有效性方面定量优于基线方法。我们证明,我们的算法能够鲁棒地计算涉及真实世界人与物体、场景及人交互的大规模轨迹集的语义标签。
引用
@article{arxiv.1712.01359,
title = {3D Semantic Trajectory Reconstruction from 3D Pixel Continuum},
author = {Jae Shin Yoon and Ziwei Li and Hyun Soo Park},
journal= {arXiv preprint arXiv:1712.01359},
year = {2017}
}