中文

基于数据关联与地标估计的图像序列三维物体理解自监督学习

计算机视觉与模式识别 2021-04-16 v1

摘要

本文提出一种用于多物体姿态估计的自监督学习方法。从二维图像理解三维物体是一项具有挑战性的任务,需从降维信息推断额外维度。尤其不同于物体分类等其他简单聚类任务,物体的三维定位或朝向估计需要精确推理。因此训练数据集的规模变得更为关键。然而,由于三维标注昂贵且耗时,获取大规模三维数据集十分困难。若能通过引入简单导航所得图像序列来扩大训练数据集规模,则可克服数据集规模限制并高效适应新环境。但当网络自身对单幅图像进行自标注时,网络的训练性能受限于其自身性能。因此我们提出一种利用图像序列中物体多次观测以超越自性能的策略:首先通过网路预测与数据关联估计全局物体地图的地标,并获得单帧的修正标注;随后将自标注获得的数据集纳入进行网络微调,从而突破网络自身的性能边界。所提方法在KITTI驾驶场景数据集上评估,展示了三维空间中多物体姿态估计的性能提升。

关键词

引用

@article{arxiv.2104.07077,
  title  = {Self-supervised Learning of 3D Object Understanding by Data Association and Landmark Estimation for Image Sequence},
  author = {Hyeonwoo Yu and Jean Oh},
  journal= {arXiv preprint arXiv:2104.07077},
  year   = {2021}
}