TO-Scene:面向三维桌面场景理解的大规模数据集
计算机视觉与模式识别
2022-07-21 v3
摘要
许多基本室内活动(如用餐、书写)总是在不同桌面上(如咖啡桌、写字台)进行。在三维室内场景解析应用中,理解桌面场景不可或缺。遗憾的是,由于当前数据集中极少包含三维桌面场景,直接部署数据驱动算法难以满足该需求。为弥补这一缺陷,我们推出 TO-Scene,一个聚焦桌面场景的大规模数据集,包含 20,740 个场景及三种变体。为获取数据,我们设计了一个高效可扩展的框架:开发众包 UI 将 ModelNet 与 ShapeNet 中的 CAD 物体迁移至 ScanNet 的桌子之上,随后将生成的桌面场景模拟为真实扫描并自动标注。进一步,我们提出一种桌面感知学习策略以更好地感知小尺寸桌面实例。值得注意的是,我们还提供了真实扫描测试集 TO-Real 以验证 TO-Scene 的实用价值。实验表明,在 TO-Scene 上训练的算法确实可作用于真实测试数据,且我们提出的桌面感知学习策略大幅提升了三维语义分割与物体检测任务上的 SOTA 结果。数据集与代码见 https://github.com/GAP-LAB-CUHK-SZ/TO-Scene。
引用
@article{arxiv.2203.09440,
title = {TO-Scene: A Large-scale Dataset for Understanding 3D Tabletop Scenes},
author = {Mutian Xu and Pei Chen and Haolin Liu and Xiaoguang Han},
journal= {arXiv preprint arXiv:2203.09440},
year = {2022}
}
备注
ECCV 2022 (Oral Presentation)