ILabel:交互式神经场景标注
计算机视觉与模式识别
2021-12-06 v2
摘要
使用3D神经场联合表示几何、颜色和语义,能够在用户使用手持RGB-D传感器实时重建场景时,从极稀疏的交互中实现准确的稠密标注。我们的iLabel系统无需训练数据,却比在大型、昂贵标注的图像数据集上训练的标准方法能更准确地稠密标注场景。此外,它以“开放集”方式工作,语义类别由用户即时定义。iLabel的底层模型是一个多层感知机(MLP),从零开始实时训练以学习联合神经场景表示。场景模型被实时更新和可视化,使用户能够聚焦交互以实现高效标注。一个房间或类似场景仅需数十次点击即可准确标注为10个以上语义类别。定量标注精度随点击次数强力提升,并迅速超越标准预训练语义分割方法。我们还展示了一种分层标注变体。
引用
@article{arxiv.2111.14637,
title = {ILabel: Interactive Neural Scene Labelling},
author = {Shuaifeng Zhi and Edgar Sucar and Andre Mouton and Iain Haughton and Tristan Laidlow and Andrew J. Davison},
journal= {arXiv preprint arXiv:2111.14637},
year = {2021}
}
备注
Project page: https://edgarsucar.github.io/ilabel/ Video: https://youtu.be/bL7RZaMhRbk