中文

使用几何生成模型的构造正确性视觉姿态估计

机器人学 2026-01-27 v1

摘要

我们考虑自主系统的视觉姿态估计问题。虽然深度神经网络已成功用于基于视觉的任务,但它们本质上缺乏对其输出正确性的可证明保证,而这对于安全关键应用至关重要。我们提出了一个用于设计可认证神经网络(NN)的框架,用于基于感知的姿态估计,该框架将物理驱动建模与基于学习的估计相结合。所提出的框架首先利用环境中常见的平面物体(如交通标志和跑道标线,称为目标物体)的已知几何结构。其核心是引入了一个几何生成模型(GGM),这是一种类似神经网络的模型,其参数源自相机观测到的目标物体的图像形成过程。一旦设计完成,GGM 即可用于训练具有估计误差认证保证的基于 NN 的姿态估计器。我们首先在无杂乱环境中演示了该框架,其中目标物体是相机视场中唯一存在的物体。我们利用 NN 可达性分析的思想对此进行了扩展,以设计能够在杂乱环境中检测目标物体存在的认证物体 NN。随后,该框架将认证物体检测器与认证姿态估计器相结合,设计了一个多阶段感知流水线,在保持其认证保证的同时,将所提出的方法推广至杂乱环境。我们使用自动驾驶车辆常见的各种平面物体的合成和真实图像对所提出的框架进行了评估。使用基于事件的相机捕获的图像,我们表明训练的编码器能够根据框架提供的认证界限有效估计交通标志的姿态。

关键词

引用

@article{arxiv.2601.17556,
  title  = {Correct-by-Construction Vision-based Pose Estimation using Geometric Generative Models},
  author = {Ulices Santa Cruz and Mahmoud Elfar and Yasser Shoukry},
  journal= {arXiv preprint arXiv:2601.17556},
  year   = {2026}
}