中文

关于视觉问答中语言模态的实证研究

人工智能 2023-09-06 v2 计算机视觉与模式识别

摘要

在 AI 领域,超越领域内经验向分布外数据的泛化具有至关重要的意义。近来,最先进的视觉问答 (VQA) 模型在领域内数据上表现出令人印象深刻的性能,部分原因是语言先验偏差,然而这在实践中阻碍了泛化能力。本文试图从实证研究的角度,为语言模态对 VQA 性能的影响提供新的见解。为此,我们在六个模型上进行了一系列实验。这些实验结果表明:1) 除了问题类型引起的先验偏差外,后缀相关偏差在诱发偏差方面也有显著影响;2) 用词序列相关的变体问题训练 VQA 模型,在分布外基准上表现出性能提升,LXMERT 甚至在不采用任何去偏方法的情况下实现了 10 分的增益。我们深入探讨了这些实验结果背后的潜在原因,并提出了一些简单的建议以减少模型对语言先验的依赖。实验结果证明了我们提出的方法在提高分布外基准 VQA-CPv2 性能方面的有效性。我们希望这项研究能为未来设计减偏方法的研究提供新的见解。

关键词

引用

@article{arxiv.2305.10143,
  title  = {An Empirical Study on the Language Modal in Visual Question Answering},
  author = {Daowan Peng and Wei Wei and Xian-Ling Mao and Yuanyuan Fu and Dangyang Chen},
  journal= {arXiv preprint arXiv:2305.10143},
  year   = {2023}
}

备注

Accepted by IJCAI2023