基于 3D 模型进行目标识别的带坐标度量学习的生成模型
计算机视觉与模式识别
2022-05-10 v2
摘要
给定大量用于训练的真实照片,卷积神经网络在目标识别任务中展现出优异的性能。然而,收集数据的过程十分繁琐,且背景也受限,这使得建立完美的数据库变得困难。在本文中,我们利用从 3D 模型渲染的合成图像训练的生成模型,减少了数据收集的工作量和条件限制。我们的结构由两个子网络组成:基于贝叶斯推断的语义前景目标重建网络,以及基于多三元组代价函数的分类网络;后者通过在每个类别中建立描述符的类球面分布,避免了单调表面上的过拟合问题,并充分利用了姿态信息,这有助于根据渲染图像的姿态、光照条件、背景和类别信息对常规照片进行识别。首先,我们称为带度量学习的生成模型的共轭结构,利用由贝叶斯渲染生成的额外前景目标通道作为两个子网络的联合。用于目标识别的基于姿态的多三元组代价函数被用于度量学习,这使得纯粹基于合成数据训练类别分类器成为可能。其次,我们设计了一种协同训练策略,借助作为输入图像损坏的自适应噪声,帮助两个子网络相互受益,并避免由于两个子网络收敛速度不同而导致的不协调参数调优。我们的结构在 ShapeNet 数据库上实现了超过 50% 的 SOTA 准确率,克服了从合成图像到真实照片的数据迁移障碍。该流程使得仅基于 3D 模型对真实图像进行识别成为可能。
引用
@article{arxiv.1705.08590,
title = {Generative Model with Coordinate Metric Learning for Object Recognition Based on 3D Models},
author = {Yida Wang and Weihong Deng},
journal= {arXiv preprint arXiv:1705.08590},
year = {2022}
}
备注
14 pages