中文

增强视觉问答文本特征提取:一种简单卷积方法

计算机视觉与模式识别 2025-05-22 v3

摘要

视觉问答(Visual Question Answering, VQA)近年来成为一个高度引人关注的领域,研究者不断致力于通过高级模型(如 Transformer)来提高 VQA 的准确率。尽管存在这样的趋势,但针对文本编码器在 VQA 中的比较效果方面的工作仍有限,尤其是考虑到模型复杂度和计算效率。本文在一个成熟的 VQA 框架中,对复杂利用长程依赖关系的文本模型与专注于局部文本特征的简单模型进行了全面比较。我们的发现表明,对于 VQA-v2 数据集,采用复杂的文本编码器并非总是最优方法。基于这一洞察,我们提出 ConvGRU,一种融合卷积层以改进文本特征表示而不显著增加模型复杂度的模型。在 VQA-v2 数据集上测试后,ConvGRU 对 Number 和 Count 等问题类型实现了对基线模型的温和而持续的改进,凸显了在计算资源有限的情况下轻量级架构对 VQA 任务的潜在价值。

关键词

引用

@article{arxiv.2405.00479,
  title  = {Enhanced Textual Feature Extraction for Visual Question Answering: A Simple Convolutional Approach},
  author = {Zhilin Zhang and Fangyu Wu},
  journal= {arXiv preprint arXiv:2405.00479},
  year   = {2025}
}

备注

To be published in 2025 6th International Conference on Computer Vision and Computational Intelligence (CVCI 2025)