用于三维物体检索的视图 N-gram 网络
计算机视觉与模式识别
2019-08-16 v2
摘要
如何将三维物体的多视图表示聚合成信息丰富且具有判别力的单一表示,仍是多视图三维物体检索的关键挑战。现有方法要么使用忽略不同视图间空间信息的视图级池化策略,要么采用可能面临效率问题的循环神经网络。为解决这些问题,我们提出了一种高效且有效的框架,称为视图 N-gram 网络(VNN)。受自然语言处理中 n-gram 模型的启发,VNN 将视图序列划分为一组视觉 n-gram,其包含重叠的连续视图子序列。通过这种方式,捕获了多视图间的空间信息,有助于为每个三维物体学习具有判别力的全局嵌入。在包括 ModelNet10、ModelNet40 和 ShapeNetCore55 数据集的三维形状检索基准上的实验证明了我们所提方法的优越性。
引用
@article{arxiv.1908.01958,
title = {View N-gram Network for 3D Object Retrieval},
author = {Xinwei He and Tengteng Huang and Song Bai and Xiang Bai},
journal= {arXiv preprint arXiv:1908.01958},
year = {2019}
}
备注
The paper was accepted to ICCV 2019