视觉概念推理网络
计算机视觉与模式识别
2020-08-28 v1 人工智能
机器学习
摘要
拆分-变换-合并策略已广泛用作卷积神经网络用于视觉识别任务的架构约束。它通过显式定义多个分支来同时学习具有不同视觉概念或属性的表示,从而近似稀疏连接网络。然而,这些表示之间的依赖或交互通常由稠密且局部的操作定义,没有任何自适应性或高层推理。在本工作中,我们提出利用该策略并将其与我们的视觉概念推理网络(VCRNet)结合,以实现高层视觉概念之间的推理。我们将每个分支关联一个视觉概念,并通过注意力模块选取若干局部描述子导出紧凑的概念状态。这些概念状态随后通过基于图的交互进行更新,并用于自适应地调制局部描述子。我们通过拆分-变换-注意力-交互-调制-合并阶段来描述所提模型,其以高度模块化的架构实现。在图像分类、语义分割、目标检测、场景识别和动作识别等视觉识别任务上的大量实验表明,我们提出的模型 VCRNet 在参数数量增加不到 1% 的情况下持续提升性能。
引用
@article{arxiv.2008.11783,
title = {Visual Concept Reasoning Networks},
author = {Taesup Kim and Sungwoong Kim and Yoshua Bengio},
journal= {arXiv preprint arXiv:2008.11783},
year = {2020}
}
备注
Preprint