中文

揭示基于 RGB 的 6-DoF 物体位姿估计中背景引入的偏差

计算机视觉与模式识别 2023-04-18 v1 人工智能

摘要

近年来,在工业环境中使用数据驱动方法的趋势日益增长。这类方法通常处理视频图像或部件,因此图像的完整性至关重要。有时数据集(例如由图像组成的数据集)会因各种原因而变得复杂。理解视频和图像的处理方式如何影响机器学习方法的有效性变得至关重要。我们的案例研究正是旨在分析 Linemod 数据集,该数据集被认为是 6D 位姿估计领域的 SOTA。该数据集呈现带有 ArUco 标记的图像;显然,在真实世界环境中这类标记并不可用。我们分析了标记的存在如何影响位姿估计精度,以及这种偏差如何通过数据增强和其他方法得以缓解。我们的工作旨在展示这些标记的存在如何在测试阶段改变所用深度学习方法的效能。特别地,我们将通过显著性图工具展示神经网络的部分注意力如何被这些 ArUco 标记所捕获。最后,将通过几何工具应用于 Linemod 得到的新数据集将被提出,以证明我们的假设并揭示该偏差。我们的结果表明了 6DOF 位姿估计网络中存在偏差的可能性,并提出了在使用标记训练时减小该偏差的方法。

关键词

引用

@article{arxiv.2304.08230,
  title  = {Uncovering the Background-Induced bias in RGB based 6-DoF Object Pose Estimation},
  author = {Elena Govi and Davide Sapienza and Carmelo Scribano and Tobia Poppi and Giorgia Franchini and Paola Ardòn and Micaela Verucchi and Marko Bertogna},
  journal= {arXiv preprint arXiv:2304.08230},
  year   = {2023}
}

备注

17 pages, 10 figures, submitted to EURASIP Journal on Image and Video Processing