迈向具身语义中央凹:基于自我中心眼动仪视频的语义三维场景重建
计算机视觉与模式识别
2018-07-30 v1 人机交互
机器人学
摘要
将物理环境纳入考量对于在非受限日常任务中完整理解人类行为至关重要。这在自我中心任务中尤为关键,因为当前2D视频分析方法尚不充分,获取三维信息既受限又具挑战。在此我们展示了一个概念验证系统,该系统通过头戴式眼动追踪眼镜获取的3D注视点估计,从自我中心RGB-D视频流实时提供局部环境的三维建图与语义标注。我们用采集的注视向量增强了语义同步定位与建图(Semantic SLAM)的现有工作。我们的系统随后能够以合理精度从多视角在三维空间中查找并跟踪用户视场内外物体。我们通过使用NYUv2数据集的图像生成语义地图,同时根据数据集图像的已记录注视数据估计注视位置和注视类别,从而验证了我们的概念。
引用
@article{arxiv.1807.10561,
title = {Towards an Embodied Semantic Fovea: Semantic 3D scene reconstruction from ego-centric eye-tracker videos},
author = {Mickey Li and Noyan Songur and Pavel Orlov and Stefan Leutenegger and A Aldo Faisal},
journal= {arXiv preprint arXiv:1807.10561},
year = {2018}
}