图像集视觉问答分析
计算机视觉与模式识别
2021-04-02 v1 计算与语言
机器学习
摘要
我们针对 ISVQA 数据集的多图像设定下的视觉问答(VQA)挑战展开研究。传统的 VQA 任务聚焦于单图像设定,即目标答案由单幅图像生成。而图像集 VQA 由一组图像组成,要求发现图像间的联系,基于这些联系关联跨图像的对象,并生成统一答案。在本报告中,我们采用 4 种方法以期提升该任务的性能。我们分析并将我们的结果与三种基线模型——LXMERT、HME-VideoQA 和 VisualBERT——进行比较,表明我们的方法相较基线可带来轻微提升。具体而言,我们尝试通过增强的预训练改善模型的空间感知并帮助模型识别颜色,利用对抗正则化降低语言依赖性,以及使用回归损失和基于图的去重改进计数。我们进一步对 ISVQA 数据集中的语言偏差进行深入分析,展示在 ISVQA 上训练的模型如何隐式地学习将语言与最终答案更强地关联起来。
引用
@article{arxiv.2104.00107,
title = {Analysis on Image Set Visual Question Answering},
author = {Abhinav Khattar and Aviral Joshi and Har Simrat Singh and Pulkit Goel and Rohit Prakash Barnwal},
journal= {arXiv preprint arXiv:2104.00107},
year = {2021}
}