VERAM:用于三维形状分类的视图增强循环注意力模型
计算机视觉与模式识别
2018-08-22 v1 图形学
摘要
多视图深度神经网络或许是三维形状分类中最成功的方法。然而,基于最大或平均池化的多视图特征融合缺乏视图选择机制,限制了其在例如机器人多视图主动物体识别中的应用。本文提出 VERAM,一种能够主动选择视图序列以实现高精度三维形状分类的循环注意力模型。VERAM 解决了现有基于注意力的模型中普遍存在一个的重要问题,即对应于下一视图估计与形状分类的子网络训练不平衡。分类子网络容易过拟合,而视图估计子网络通常训练不足,导致次优的分类性能。这通过三种必要的视图增强策略克服:1)增强视图估计子网络梯度反向传播的信息流,2)为视图估计的强化训练设计高信息量的奖励函数,以及 3)构造显式避免视图重复的新型损失函数。以灰度图像为输入、AlexNet 为 CNN 架构,VERAM 使用 9 个视图在 ModelNet10 上达到实例级和类级准确率 95.5% 和 95.3%,在 ModelNet40 上达到 93.7% 和 92.1%,二者均为相同视图数下的 SOTA 性能。
引用
@article{arxiv.1808.06698,
title = {VERAM: View-Enhanced Recurrent Attention Model for 3D Shape Classification},
author = {Songle Chen and Lintao Zheng and Yan Zhang and Zhixin Sun and Kai Xu},
journal= {arXiv preprint arXiv:1808.06698},
year = {2018}
}
备注
Accepted by IEEE Transactions on Visualization and Computer Graphics. Corresponding Author: Kai Xu ([email protected])