视觉与语言推理:补充知识增益探究
计算机视觉与模式识别
2021-01-18 v1 机器学习
摘要
视觉-语言模型的适用界限由其训练数据的覆盖度所界定。诸如视觉问答(VQA)等任务常需要超出任务特定数据集可学习范围的常识与事实信息。本文研究将通用知识库(KB)中的知识注入视觉-语言transformer的方法。我们采用一种辅助训练目标,鼓励所学表征与KB中匹配实体的图嵌入对齐。我们实证研究了各类KB与多个任务和基准的相关度。该技术通过捕获现有模型所缺失的语义与关系知识,为需知识的问答任务(OK-VQA、FVQA)带来明确增益。更令人意外的是,该技术亦有益于视觉推理任务(NLVR2、SNLI-VE)。我们开展探测实验并表明,额外知识的注入正则化了嵌入空间,从而改进词法与语义相似性的表示。该技术模型无关,能以极小计算开销拓展任意视觉-语言transformer的适用性。
引用
@article{arxiv.2101.06013,
title = {Reasoning over Vision and Language: Exploring the Benefits of Supplemental Knowledge},
author = {Violetta Shevchenko and Damien Teney and Anthony Dick and Anton van den Hengel},
journal= {arXiv preprint arXiv:2101.06013},
year = {2021}
}