中文

CM-EVS:面向完整场景覆盖的稀疏全景 RGB-D-位姿数据

计算机视觉与模式识别 2026-05-18 v1 图形学 机器学习 机器人学

摘要

现代三维视觉学习依赖于从度量三维资产中采样的观测,然而现有的扫描、网格、点云、仿真和重建并不能直接提供一个稀疏、可比较且几何一致的全景训练接口。密集轨迹会重复采样邻近视图,特定于源的渲染策略会产生异构标注,而稀疏启发式方法可能遗漏重要区域或引入深度不一致的观测。我们研究如何将三维资产转换为稀疏的全景 RGB-D-位姿数据,以在低冗余和可审计溯源的前提下保持完整的场景覆盖。我们提出 COVER(面向覆盖的视点筛选与 ERP 范围-深度变形),一种无需训练的 ERP 视点筛选器,它将从选定视图观测到的几何结构投影到候选 ERP 探针中,对增量覆盖进行评分,并对深度冲突进行惩罚。在有界代理误差下,其贪心覆盖代理保持了标准的覆盖式近似行为,仅增加一个加性误差项。利用 COVER,我们构建了 CM-EVS(覆盖筛选的度量 ERP 视图集),这是一个全景 RGB-D-位姿数据集,包含来自 Blender indoor、HM3D 和 ScanNet++ 的 1275 个室内场景的 36373 个经筛选的 ERP 帧,并辅以来自 TartanGround 和 OB3D 的、按相同模式重新编码的室外全景图。每帧提供全球面 RGB、度量距离深度、已标定位姿;COVER 生成的室内帧包含每步溯源日志。每个室内场景的中位数仅为 25 帧,CM-EVS 覆盖了所有 13 种统一的房间类型,同时保持了紧凑的场景级覆盖。实验表明,COVER 改善了覆盖-冲突权衡,使 CM-EVS 成为用于几何一致全景三维学习的稀疏、紧凑且可审计的 RGB-D-位姿资源。

关键词

引用

@article{arxiv.2605.15597,
  title  = {CM-EVS: Sparse Panoramic RGB-D-Pose Data for Complete Scene Coverage},
  author = {Jiale Liu and Jungang Li and Jieming Yu and Xinglin Yu and Zihao Dongfang and Zongjian Ding and Kaifeng Ding and Yi Yang and Lidong Chen and Yang Zou and Shunwen Bai and Jiahuan Zhang and Haoran Huang and Shan Huang and Yudong Gao and Mingjun Cheng},
  journal= {arXiv preprint arXiv:2605.15597},
  year   = {2026}
}

备注

35 pages including appendix. Code and dataset: https://github.com/Strange-animalss/CM-EVS