面向视觉问答的稀疏混合专家学习
机器学习
2019-09-23 v1 计算与语言
计算机视觉与模式识别
机器学习
摘要
视觉问答(Visual Question Answering)任务随着模型架构的改进取得了快速进展。然而,这些模型通常因其庞大的规模而计算密集,对部署构成严峻挑战。我们旨在针对视觉问答(VQA)这一特定任务解决此问题。卷积神经网络(CNN)是 VQA 模型视觉处理流程的组成部分(假设 CNN 与整个 VQA 模型一同训练)。在本项目中,我们为 VQA 任务提出了一种高效且模块化的神经架构,重点关注 CNN 模块。我们的实验表明,基于稀疏激活 CNN 的 VQA 模型,其性能可与基于标准 CNN 的 VQA 模型架构相媲美。
引用
@article{arxiv.1909.09192,
title = {Learning Sparse Mixture of Experts for Visual Question Answering},
author = {Vardaan Pahuja and Jie Fu and Christopher J. Pal},
journal= {arXiv preprint arXiv:1909.09192},
year = {2019}
}
备注
Accepted in Visual Question Answering and Dialog Workshop, CVPR 2019