中文

VQA-GEN:面向域泛化的视觉问答基准

计算机视觉与模式识别 2023-11-03 v1 机器学习

摘要

视觉问答(VQA)模型旨在展现视觉-文本推理能力。然而,缺乏全面的基准数据集阻碍了其在实际场景中的适用性。现有的VQA域泛化数据集单方面关注文本偏移,而VQA作为多模态任务同时包含视觉与文本域的偏移。我们提出VQA-GEN,这是首个通过偏移诱导流水线生成的用于分布偏移的多模态基准数据集。实验表明,VQA-GEN数据集暴露了现有方法对联合多模态分布偏移的脆弱性,验证了全面的多模态偏移对于鲁棒VQA泛化至关重要。在VQA-GEN上训练的模型展现出改进的跨域与域内性能,证实了VQA-GEN的价值。此外,我们分析了流水线中各项偏移技术对模型泛化贡献的重要性。

关键词

引用

@article{arxiv.2311.00807,
  title  = {VQA-GEN: A Visual Question Answering Benchmark for Domain Generalization},
  author = {Suraj Jyothi Unni and Raha Moraffah and Huan Liu},
  journal= {arXiv preprint arXiv:2311.00807},
  year   = {2023}
}