生成式视觉问答
计算机视觉与模式识别
2023-07-21 v1 人工智能
摘要
深度学习里涉及视觉与语言的多模态任务持续流行,并推动能够泛化超越其训练数据范围的 newer 模型的发展。当前模型缺乏时间泛化能力,而该能力可使模型适应未来数据的变化。本文讨论了一种构建先进视觉问答(VQA)模型的可行方法,该模型能在时间泛化上取得良好结果。我们提出一个新数据集 GenVQA,利用 VQAv2 和 MS-COCO 数据集的图像与描述,通过 stable diffusion 生成新图像。该增广数据集随后用于测试七种基线与前沿 VQA 模型的组合。性能评估聚焦于镜像原始 VQAv2 数据集的问题,其答案已针对新图像进行调整。本文旨在研究若干成功 VQA 模型的鲁棒性,以评估它们在未来数据分布上的表现。我们分析模型架构以识别在时间分布偏移下提升泛化的常见风格化选择。本研究强调了创建大规模未来偏移数据集的重要性。此类数据可增强 VQA 模型的鲁棒性,使其后续同类模型具备更好的适应时间分布偏移的能力。
引用
@article{arxiv.2307.10405,
title = {Generative Visual Question Answering},
author = {Ethan Shen and Scotty Singh and Bhavesh Kumar},
journal= {arXiv preprint arXiv:2307.10405},
year = {2023}
}