球面 Transformer:将球面信号适配于 CNN
计算机视觉与模式识别
2022-09-05 v3
摘要
卷积神经网络(CNNs)已广泛应用于各类视觉任务,如图像分类、语义分割等。遗憾的是,标准二维 CNNs 并不适用于全景图像或球面投影等球面信号,因为球面是一种非结构化网格。本文提出 Spherical Transformer,可将球面信号转换为可直接由标准 CNNs 处理的向量,从而通过预训练在许多精心设计的 CNNs 架构中实现跨任务和跨数据集复用。为此,该方法首先使用 HEALPix 等局部结构化采样方法,利用球面点及其邻域点的信息构建 transformer 网格,然后通过该网格将球面信号转换为向量。通过构建 Spherical Transformer 模块,我们可以直接使用多种 CNN 架构。我们在球面 MNIST 识别、三维物体分类和全向图像语义分割任务上评估了我们的方法。对于三维物体分类,我们进一步提出一种基于渲染的投影方法以提升性能,并提出一种旋转等变模型以增强抗旋转能力。三项任务的实验结果表明,我们的方法优于当前最优(state-of-the-art)方法。
引用
@article{arxiv.2101.03848,
title = {Spherical Transformer: Adapting Spherical Signal to CNNs},
author = {Yuqi Liu and Yin Wang and Haikuan Du and Shen Cai},
journal= {arXiv preprint arXiv:2101.03848},
year = {2022}
}
备注
acceptedy by PRCV2022