中文

基于姿态自编码器的相对姿态回归:提升零售场景中的精度与数据效率

计算机视觉与模式识别 2025-08-18 v1 图像与视频处理

摘要

精准的相机定位对于现代零售环境至关重要,能够提升客户体验、 streamlining 库存管理以及实现自主运营。虽然从单张图像进行绝对姿态回归(Absolute Pose Regression, APR)提供了可行的解决方案,但 incorporating 视觉和空间场景先验信息的方法往往能够获得更高的精度。Camera Pose Auto-Encoders(PAE)最近被引入用于将此类先验信息嵌入 APR 中。本文将 PAEs 扩展至相对姿态回归(Relative Pose Regression, RPR)任务,并提出一种新颖的再定位方案,通过 PAE 基于 RPR 的方法对 APR 预测进行细化,无需额外存储图像或姿态数据。我们首先引入 PAE 基于 RPR 方法,并通过与等效架构的图像基 RPR 模型进行比较来确证其有效性。随后我们展示,由 PAE 基于 RPR 驱动的细化策略能够提升室内基准数据集上的 APR 定位精度。值得注意的是,即使仅使用 30% 的训练数据,我们的方法也能实现竞争性能,显著降低了零售部署的数据收集负担。我们的代码和预训练模型已提供:https://github.com/yolish/camera-pose-auto-encoders

关键词

引用

@article{arxiv.2508.10933,
  title  = {Relative Pose Regression with Pose Auto-Encoders: Enhancing Accuracy and Data Efficiency for Retail Applications},
  author = {Yoli Shavit and Yosi Keller},
  journal= {arXiv preprint arXiv:2508.10933},
  year   = {2025}
}

备注

Accepted to ICCVW 2025