VLC-BERT:基于上下文常识知识的视觉问答模型
计算机视觉与模式识别
2022-10-26 v1 计算与语言
摘要
近来,人们对解决需要模型超越图像内容进行推理的视觉问答(VQA)任务兴趣渐增。在这项工作中,我们关注需要常识推理的问题。与以往从静态知识库注入知识的方法不同,我们研究利用 Commonsense Transformer(COMET,一个在人工整理知识库上训练得到的现有知识模型)来融入上下文常识知识。我们提出一种方法,在新的预训练视觉-语言-常识 transformer 模型 VLC-BERT 中,与视觉和文本线索一同生成、筛选并编码外部常识知识。通过对依赖知识的 OK-VQA 和 A-OKVQA 数据集的评估,我们表明 VLC-BERT 能够超越利用静态知识库的现有模型。此外,通过详细分析,我们解释了哪些问题受益于、哪些未受益于来自 COMET 的上下文常识知识。
引用
@article{arxiv.2210.13626,
title = {VLC-BERT: Visual Question Answering with Contextualized Commonsense Knowledge},
author = {Sahithya Ravi and Aditya Chinchure and Leonid Sigal and Renjie Liao and Vered Shwartz},
journal= {arXiv preprint arXiv:2210.13626},
year = {2022}
}
备注
Accepted at WACV 2023. For code and supplementary material, see https://github.com/aditya10/VLC-BERT