CAD-Estate:RGB 视频中的大规模 CAD 模型标注
计算机视觉与模式识别
2023-08-15 v2
摘要
我们提出一种用全局一致的物体三维表示来标注复杂多物体场景视频的方法。我们用数据库中的 CAD 模型标注每个物体,并通过 9 自由度位姿变换将其放置于场景的三维坐标系内。我们的方法是半自动的,适用于常见的可用 RGB 视频,无需深度传感器。许多步骤自动完成,人类执行的任务简单、明确,且仅需有限的三维推理。这使其适合众包,并使我们能够通过标注 YouTube 上的房地产视频构建大规模数据集。我们的数据集 CAD-Estate 提供 20k 个视频的三维表示中放置的 12k 个独特 CAD 模型的 101k 个实例。与现有最大的真实场景 CAD 模型标注数据集 Scan2CAD 相比,CAD-Estate 的实例数多 7 倍,独特 CAD 模型多 4 倍。我们展示了在 CAD-Estate 上预训练 Mask2CAD 模型用于自动三维物体重建与位姿估计任务的益处,证明其在流行的 Scan2CAD 基准上带来性能提升。数据集可在 https://github.com/google-research/cad-estate 获取。
引用
@article{arxiv.2306.09011,
title = {CAD-Estate: Large-scale CAD Model Annotation in RGB Videos},
author = {Kevis-Kokitsi Maninis and Stefan Popov and Matthias Nießner and Vittorio Ferrari},
journal= {arXiv preprint arXiv:2306.09011},
year = {2023}
}
备注
Project page: https://github.com/google-research/cad-estate