中文

面向视觉问答的稀疏混合专家学习

机器学习 2019-09-23 v1 计算与语言 计算机视觉与模式识别 机器学习

摘要

视觉问答(Visual Question Answering)任务随着模型架构的改进取得了快速进展。然而,这些模型通常因其庞大的规模而计算密集,对部署构成严峻挑战。我们旨在针对视觉问答(VQA)这一特定任务解决此问题。卷积神经网络(CNN)是 VQA 模型视觉处理流程的组成部分(假设 CNN 与整个 VQA 模型一同训练)。在本项目中,我们为 VQA 任务提出了一种高效且模块化的神经架构,重点关注 CNN 模块。我们的实验表明,基于稀疏激活 CNN 的 VQA 模型,其性能可与基于标准 CNN 的 VQA 模型架构相媲美。

关键词

引用

@article{arxiv.1909.09192,
  title  = {Learning Sparse Mixture of Experts for Visual Question Answering},
  author = {Vardaan Pahuja and Jie Fu and Christopher J. Pal},
  journal= {arXiv preprint arXiv:1909.09192},
  year   = {2019}
}

备注

Accepted in Visual Question Answering and Dialog Workshop, CVPR 2019