中文

Every9D-21M:大规模真实世界 9D 姿态标准化数据集

计算机视觉与模式识别 2026-05-28 v1

摘要

从单张真实世界图像估计日常物品的 9D 位姿仍具有挑战性。这在很大程度上源于缺乏大规模监督数据。大多数现有数据集要么严重依赖合成渲染,要么提供的日常物品覆盖范围有限:目前规模最大的真实世界 9D 位姿数据集仅包含 1.7 万张标注图像,覆盖 9 个类别。为填补这一空白,我们提出 Every9D-21M,一个包含 2180 万张真实世界图像的 9D 位姿标注数据集,这些图像来自 109 万片以物品为中心的视频,涵盖 700 种日常物品类别——在图像数量和类别数量上都比现有真实世界 9D 位姿基准数据集大两个数量级。为实现此规模,我们利用物品中心视频,通过多视图几何重建物品级别的点云,并将相似实例对齐到共享的标准坐标系中。仅对少数参考物品进行手动标注(小于 0.01% 的图像),其余实例通过跨实例对齐获得标准位姿。所有传递的标准位姿随后从多个视角进行验证。我们进一步引入跨类别方向规则,诱导出类别级对称性,实现对称感知的评估。除建立专门的训练和评估划分作为 9D 位姿基础模型基准外,我们展示在 ImageNet3D 和 PASCAL3D+ 上的训练效果,并且在 HANDAL 上的泛化能力显著优于仅在 ImageNet3D 上训练。数据和代码均已公开于 https://github.com/GenIntel/Every9D。

关键词

引用

@article{arxiv.2605.28270,
  title  = {Every9D-21M: Large-Scale Real-World 9D Canonicalization of Everyday Objects},
  author = {Leonhard Sommer and Emil Akopyan and Adam Kortylewski},
  journal= {arXiv preprint arXiv:2605.28270},
  year   = {2026}
}