中文

面向 Egocentric 相机姿态估计的自适应测地 conformal 预测

计算机视觉与模式识别 2026-05-04 v1

摘要

增强现实(AR)和助听器设备需要的以人为中心的姿态估计不仅要求精确的预测,还要求保证不确定性区域。Conformal 预测(Conformal prediction, CP)可在不重新训练的情况下提供此类保证,但我们发现标准 CP 使用单个固定阈值虽实现整体覆盖率为 90%,但仅覆盖约 60% 的最难 25% 帧(Q4),在 12 名参与者、3 个预测器和 3 个时间范围(共 108 次评估)上的 EPIC-Fields 数据集中存在约 30 个百分点的条件覆盖差距。我们进一步表明,测地 SE(3) 非合理得分能识别出比欧几里得评分更难的帧,仅有 15-26% 的 Q4 重叠,且地面实验相机位移为 2-3 倍。为缩小覆盖差距,我们提出 DINOv2-Bridge 自适应 CP:一个基于单一来源参与者训练的两阶段难度估计器,可在不使用任何测试图像的情况下跨参与者迁移,将 Q4 覆盖率从约 0.75 提升到约 0.93,同时保持在 90% 目标上的整体覆盖率。

关键词

引用

@article{arxiv.2605.00233,
  title  = {Adaptive Geodesic Conformal Prediction for Egocentric Camera Pose Estimation},
  author = {Aishani Pathak and Hasti Seifi},
  journal= {arXiv preprint arXiv:2605.00233},
  year   = {2026}
}