中文

面向高效场景理解的可压缩推理方法

计算机视觉与模式识别 2021-09-01 v3

摘要

基于图的卷积模型(如非局部块)已被证明能有效增强卷积神经网络(CNNs)中的上下文建模能力。然而,其逐像素的计算开销令人望而却步,使其不适用于高分辨率图像。本文中,我们探究上下文图推理的效率并提出一种称为可压缩推理(Squeeze Reasoning)的新框架。我们并非在空间图上传播信息,而是首先学习将输入特征压缩为通道级全局向量,并在该单一向量内执行推理,从而显著降低计算成本。具体而言,我们在该向量中构建节点图,其中每个节点代表一个抽象语义概念。同一语义类别内的精炼特征趋于一致,因而有益于下游任务。我们表明所提方法可模块化为端到端训练的块,并能轻松插入现有网络。尽管其简单且轻量,所提策略使我们能在不同语义分割数据集上取得可观结果,并在其他多种场景理解任务(包括目标检测、实例分割和全景分割)上相较强基线显示出显著改进。代码见 \url{https://github.com/lxtGH/SFSegNets}。

关键词

引用

@article{arxiv.2011.03308,
  title  = {Towards Efficient Scene Understanding via Squeeze Reasoning},
  author = {Xiangtai Li and Xia Li and Ansheng You and Li Zhang and Guangliang Cheng and Kuiyuan Yang and Yunhai Tong and Zhouchen Lin},
  journal= {arXiv preprint arXiv:2011.03308},
  year   = {2021}
}

备注

Accepted by IEEE-TIP