SelfGraphVQA:一种用于基于场景的视觉问答的自监督图神经网络
计算机视觉与模式识别
2023-10-04 v1
摘要
由于人们对识别与推理之间无缝集成的日益关注,视觉与语言的交叉领域受到了极大关注。场景图(SGs)已成为多模态图像分析的有用工具,在视觉问答(VQA)等任务中展现出令人印象深刻的性能。在这项工作中,我们证明尽管场景图在 VQA 任务中有效,但当前利用理想化标注场景图的方法在使用从图像中提取的预测场景图时难以泛化。为解决此问题,我们引入了 SelfGraphVQA 框架。我们的方法使用预训练的场景图生成器从输入图像中提取场景图,并采用语义保持的增强与自监督技术。该方法通过规避对昂贵且可能存在偏差的标注数据的需求,改善了 VQA 任务中图表示的利用。通过图像增强创建提取图的替代视图,我们可以利用非归一化对比方法优化其表示中的信息内容来学习联合嵌入。由于我们使用 SGs,我们尝试了三种不同的最大化策略:节点级、图级和置换等变正则化。我们通过实证展示了提取的场景图在 VQA 中的有效性,并证明这些方法通过凸显视觉信息的重要性提升了整体性能。这为依赖 SGs 处理复杂推理问题的 VQA 任务提供了更实用的解决方案。
引用
@article{arxiv.2310.01842,
title = {SelfGraphVQA: A Self-Supervised Graph Neural Network for Scene-based Question Answering},
author = {Bruno Souza and Marius Aasan and Helio Pedrini and Adín Ramírez Rivera},
journal= {arXiv preprint arXiv:2310.01842},
year = {2023}
}
备注
To appear in Vision-and-Language Algorithmic Reasoning Workshop at ICCV 2023