利用 3D 关键点知识引擎理解像素级 2D 图像语义
计算机视觉与模式识别
2021-11-23 v1
摘要
像素级 2D 物体语义理解是计算机视觉中的一个重要课题,可帮助机器深度理解日常生活中物体的功能与可供性。然而,大多数先前方法直接在 2D 图像中的对应关系上训练,这种方式端到端但丢失了大量 3D 空间中的信息。在本文中,我们提出一种新方法,在 3D 域中预测图像对应语义,再将其投影回 2D 图像以实现像素级理解。为获取当前图像数据集中缺失的可靠 3D 语义标签,我们构建了一个称为 KeypointNet 的大规模关键点知识引擎,包含来自 16 个物体类别的 103,450 个关键点和 8,234 个 3D 模型。我们的方法利用了 3D 视觉的优势,并能显式推理物体的自遮挡与可见性。我们表明,我们的方法在标准语义基准上给出了有竞争力甚至更优的结果。
引用
@article{arxiv.2111.10817,
title = {Understanding Pixel-level 2D Image Semantics with 3D Keypoint Knowledge Engine},
author = {Yang You and Chengkun Li and Yujing Lou and Zhoujun Cheng and Liangwei Li and Lizhuang Ma and Weiming Wang and Cewu Lu},
journal= {arXiv preprint arXiv:2111.10817},
year = {2021}
}
备注
Accepted to IEEE Transactions on Pattern Analysis and Machine Intelligence; To appear in upcoming issues