中文

具有空间编码的用于 3D 形状分析的组多视图 Transformer

计算机视觉与模式识别 2024-08-06 v3 人工智能

摘要

近年来,基于视图的 3D 形状识别方法的结果已趋于饱和,且由于参数量巨大,性能优异的模型无法部署在内存受限的设备上。为了解决这个问题,我们为该领域引入了一种基于知识蒸馏的压缩方法,该方法在尽可能保持模型性能的同时大幅减少了参数数量。具体而言,为了增强小型模型的能力,我们设计了一个高性能的大型模型,称为组多视图 Vision Transformer(GMViT)。在 GMViT 中,视图级 ViT 首先建立视图级特征之间的关系。此外,为了捕捉更深层的特征,我们采用分组模块将视图级特征增强为组级特征。最后,组级 ViT 将组级特征聚合为完整、结构良好的 3D 形状描述符。值得注意的是,在这两个 ViT 中,我们引入了相机坐标的空间编码作为创新的位置嵌入。此外,我们提出了基于 GMViT 的两个压缩版本,即 GMViT-simple 和 GMViT-mini。为了增强小型模型的训练效果,我们在整个 GMViT 过程中引入了一种知识蒸馏方法,其中每个 GMViT 组件的关键输出作为蒸馏目标。大量实验证明了所提方法的有效性。大型模型 GMViT 在基准数据集 ModelNet、ShapeNetCore55 和 MCB 上取得了优异的 3D 分类和检索结果。较小的模型 GMViT-simple 和 GMViT-mini 分别将参数大小减少了 8 倍和 17.6 倍,平均将形状识别速度提高了 1.5 倍,同时保留了至少 90% 的分类和检索性能。代码地址:https://github.com/bigdata-graph/GMViT。

关键词

引用

@article{arxiv.2312.16477,
  title  = {Group Multi-View Transformer for 3D Shape Analysis with Spatial Encoding},
  author = {Lixiang Xu and Qingzhe Cui and Richang Hong and Wei Xu and Enhong Chen and Xin Yuan and Chenglong Li and Yuanyan Tang},
  journal= {arXiv preprint arXiv:2312.16477},
  year   = {2024}
}

备注

13pages, 8 figuers