中文

基于多模态融合的室内语义场景理解

计算机视觉与模式识别 2021-08-18 v1 人工智能

摘要

无缝人机交互是开发服务机器人系统的终极目标。为此,机器人智能体必须理解其周围环境以更好地完成给定任务。语义场景理解使机器人智能体能够提取关于环境中物体的语义知识。在本工作中,我们提出了一个融合 2D 与 3D 检测分支以生成环境语义图的语义场景理解流水线。来自最先进 2D 检测器的 2D 掩码提议被逆投影到 3D 空间,并与来自点分割网络的 3D 检测结果相结合。与先前在收集数据集上评估的工作不同,我们在主动照片级真实机器人环境 BenchBot 上测试了我们的流水线。我们的创新点包括利用投影的 2D 检测结果修正 3D 提议,以及基于物体尺寸的模态融合。本工作作为机器人视觉场景理解挑战(RVSU)的一部分完成。性能评估表明,我们的流水线在无明显计算瓶颈的情况下优于基线方法。

关键词

引用

@article{arxiv.2108.07616,
  title  = {Indoor Semantic Scene Understanding using Multi-modality Fusion},
  author = {Muraleekrishna Gopinathan and Giang Truong and Jumana Abu-Khalaf},
  journal= {arXiv preprint arXiv:2108.07616},
  year   = {2021}
}

备注

International Conference on Digital Image Computing: Techniques and Applications (DICTA), 5 figures, 8 pages