中文

线性上下文变换模块

机器学习 2019-11-26 v2 人工智能 计算机视觉与模式识别

摘要

压缩激励(SE)模块提出了一种通道注意力机制,通过显式捕获跨通道依赖来建模全局上下文。然而,我们仍远未理解 SE 模块如何工作。本工作中,我们首先重访 SE 模块,随后基于全局上下文与注意力分布的关系开展详实的实证研究,并据此提出一个简单而有效的模块,称为线性上下文变换(LCT)模块。我们将所有通道划分为不同组,并在每组通道内对全局聚合的上下文特征作归一化,以减少无关通道的干扰。通过对归一化上下文特征作线性变换,我们为每个通道独立建模全局上下文。LCT 模块极为轻量,易于插入不同骨干模型,且参数与计算负担的增加可忽略。大量实验表明,在 ImageNet 图像分类任务及 COCO 数据集的目标检测/分割任务上,采用不同骨干模型时 LCT 模块均优于 SE 模块。此外,不论基线模型容量如何,LCT 在现有 SOTA 检测架构上均带来一致性能提升,例如在 COCO 基准上 APbbox^{bbox} 提升 1.5\sim1.7%、APmask^{mask} 提升 1.0\sim1.2%。我们希望这一简单有效的方法能为未来基于注意力的模型研究提供些许启发。

关键词

引用

@article{arxiv.1909.03834,
  title  = {Linear Context Transform Block},
  author = {Dongsheng Ruan and Jun Wen and Nenggan Zheng and Min Zheng},
  journal= {arXiv preprint arXiv:1909.03834},
  year   = {2019}
}

备注

AAAI-2020 accepted