中文

改进的 RAMEN:面向视觉问答的域泛化

计算机视觉与模式识别 2021-09-07 v1 机器学习

摘要

视觉问答(VQA)作为人工智能中的一个新兴领域,目前已接近人类水平表现。作为机器学习中的多学科领域,计算机视觉与自然语言处理社区正协同工作以达成最先进(SOTA)性能。然而,SOTA 结果与实际应用之间存在差距,这源于模型泛化能力的不足。RAMEN 模型(Shrestha 等,2019)旨在通过两类主要 VQA 数据集上取得最高分来实现域泛化。本研究对 RAMEN 架构的早期/晚期融合模块与聚合模块进行了两项主要改进,以进一步增强域泛化。融合模块引入了基于向量操作的融合策略,聚合模块引入了 Transformer 架构。实验在多达五个 VQA 数据集上均显示出改进。基于结果,本研究分析了两项改进对域泛化问题的影响。代码已通过以下链接在 GitHub 上公开:https://github.com/bhanukaManesha/ramen。

关键词

引用

@article{arxiv.2109.02370,
  title  = {Improved RAMEN: Towards Domain Generalization for Visual Question Answering},
  author = {Bhanuka Manesha Samarasekara Vitharana Gamage and Lim Chern Hong},
  journal= {arXiv preprint arXiv:2109.02370},
  year   = {2021}
}

备注

11 pages, 3 figures, 2 tables