点击此处:以人工定位的关键点作为视点估计的引导
计算机视觉与模式识别
2017-08-08 v2
摘要
我们提出并处理了单目视点估计任务的一种人在回路变体,即在测试时已知一个语义对象关键点的位置和类别。为了利用关键点信息,我们设计了一种名为 Click-Here CNN (CH-CNN) 的卷积神经网络,该网络将关键点信息与处理图像的层产生的激活值相结合。它将关键点信息转换为 2D 映射,可用于对图像某些部分的特征赋予更高的权重。这些空间特征的加权和与全局图像特征相结合,为预测层提供相关信息。为了训练我们的网络,我们收集了一个包含数千个 CAD 模型 3D 关点标注的新颖数据集,并合成了数百万张带有 2D 关键点信息的图像。在 PASCAL 3D+ 的测试实例上,我们的模型达到了 90.7% 的平均类别准确率,而 state-of-the-art 基线仅获得 85.7% 的平均类别准确率,这证明了我们关于人在回路推断的论点。
引用
@article{arxiv.1703.09859,
title = {Click Here: Human-Localized Keypoints as Guidance for Viewpoint Estimation},
author = {Ryan Szeto and Jason J. Corso},
journal= {arXiv preprint arXiv:1703.09859},
year = {2017}
}
备注
To appear in ICCV 2017