以多任务学习方法用语义框架信息增强视觉问答
人工智能
2020-02-03 v1 计算与语言
计算机视觉与模式识别
机器学习
摘要
视觉问答(VQA)旨在对关于图像的自然语言问题给出回答。已有若干深度神经网络方法以端到端方式对该任务建模。尽管该任务立足于视觉处理,若问题聚焦于由动词描述的事件,语言理解部分就变得关键。我们的假设是,模型应当意识到动词语义,如通过语义角色标签、论元类型和/或框架元素所表达的那样。遗憾的是,现有VQA数据集均不含动词语义信息。我们的首要贡献是利用imSitu标注构建的新VQA数据集(imSituVQA)。imSitu数据集由人工标注语义框架元素的图像组成,大多取自FrameNet。其次,我们提出一种多任务CNN-LSTM VQA模型,可同时学习答案分类与语义框架元素分类。实验表明,语义框架元素分类有助于VQA系统避免不一致回答并提升性能。
引用
@article{arxiv.2001.11673,
title = {Augmenting Visual Question Answering with Semantic Frame Information in a Multitask Learning Approach},
author = {Mehrdad Alizadeh and Barbara Di Eugenio},
journal= {arXiv preprint arXiv:2001.11673},
year = {2020}
}
备注
14th IEEE International Conference on SEMANTIC COMPUTING, 8 Pages, February 2020, San Diego CA USA