中文

面向视觉问答的语义感知模块化胶囊路由

计算机视觉与模式识别 2022-07-22 v1

摘要

视觉问答(VQA)本质上具有组合性,许多问题只需将其分解为模块化子问题即可解答。近期提出的神经模块网络(NMN)采用此策略进行问答,但在网络架构设计上严重依赖现成的布局解析器或额外的专家策略,而非从数据中学习。这些策略导致模型对输入在语义复杂层面的变化适应性不佳,从而阻碍了模型的表征能力与泛化性。为解决这个问题,我们提出一种语义感知模块化胶囊路由框架,称为SUPER,以更好地捕捉特定实例的视觉-语义特征并精炼用于预测的判别性表征。具体而言,SUPER网络的每一层都定制了五个强大的专用模块以及动态路由器,并构建了紧凑的路由空间,使得各种可定制路由能够被充分利用,且视觉-语义表征能够被显式校准。我们在五个基准数据集上对比验证了所提SUPER方案的有效性、泛化能力以及参数高效的优势。需要强调的是,本工作并非追求VQA中的最先进(SOTA)结果,而是期望我们的模型能为VQA的架构学习与表征校准提供一种新颖视角。

关键词

引用

@article{arxiv.2207.10404,
  title  = {Semantic-aware Modular Capsule Routing for Visual Question Answering},
  author = {Yudong Han and Jianhua Yin and Jianlong Wu and Yinwei Wei and Liqiang Nie},
  journal= {arXiv preprint arXiv:2207.10404},
  year   = {2022}
}

备注

12 pages, 4 figures, submitted to IEEE Transactions on Image Processing