面向视觉识别的多尺度分块胶囊网络 with 跨协议路由
计算机视觉与模式识别
2026-01-29 v2
摘要
胶囊网络(CapsNet)通过捕获空间关系和部件-整体层次结构来学习等效特征表示,展现出在视觉识别中显著的潜力。然而,现有的胶囊网络及其变体常依赖单一高层特征图,忽视了来自多尺度特征的丰富互补信息。此外,传统的特征融合策略(如加法和拼接)难以调和多尺度特征之间的差异,导致分类性能次优。为此,我们提出了多尺度分块胶囊网络(MSPCaps),一种新型架构,集成了多尺度特征学习与高效胶囊路由。具体而言,MSPCaps 包含三个关键组件:多尺度 ResNet 主干网络(MSRB)、分块胶囊层(PatchifyCaps)和跨协议路由(CAR)模块。首先,MSRB 从输入图像中提取多样化的多尺度特征表示,既保留细粒度细节,又保留全局上下文信息。其次,PatchifyCaps 将这些多尺度特征划分为统一分块大小的初始胶囊,赋予模型从多样化感受野中学习的能力。最后,CAR 模块通过识别跨尺度预测对中最大协议的匹配,适应性地路由多尺度胶囊。与简单拼接多个自路由模块不同,CAR 确保只有最具一致性的胶囊才贡献最终投票。我们提出的 MSPCaps 实现了卓越的可扩展性和优异的鲁棒性,在分类准确率方面始终优于多个基线方法,配置从高效的 Tiny 模型(34.43 万参数)到强大的 Large 模型(1090 万参数)不等,凸显其在推进特征表示学习方面的潜力。
引用
@article{arxiv.2508.16922,
title = {MSPCaps: A Multi-Scale Patchify Capsule Network with Cross-Agreement Routing for Visual Recognition},
author = {Yudong Hu and Yueju Han and Rui Sun and Jinke Ren},
journal= {arXiv preprint arXiv:2508.16922},
year = {2026}
}
备注
9 pages, 4 figures; Code is available at https://github.com/abdn-hyd/MSPCaps