中文

面向 VQA 的查询感知分段与跨注意力集成

计算机视觉与模式识别 2024-07-18 v1

摘要

本文介绍了一种用于 VizWiz-VQA 的方法,采用带可训练跨注意力和 LoRA 微调的大型语言模型(LVLM)。我们按照以下条件训练模型:1)使用原始图像训练。2)使用 CLIPSeg 对图像进行增强处理,以突出或对比原始图像。3)整合 Vision Transformer(ViT)和 CLIPSeg 原始图像特征的输出特征。然后,我们基于 Levenshtein 距离对结果进行集成,以增强最终答案的预测。在实验中,我们展示并分析了所提方法的有效性。

关键词

引用

@article{arxiv.2407.12055,
  title  = {Integrating Query-aware Segmentation and Cross-Attention for Robust VQA},
  author = {Wonjun Choi and Sangbeom Lee and Seungyeon Lee and Heechul Jung and Dong-Gyu Lee},
  journal= {arXiv preprint arXiv:2407.12055},
  year   = {2024}
}

备注

CVPR Workshop accepted, Vizwiz Grand Challenge(VQA) 3rd Prize, https://vizwiz.cs.colorado.edu/VizWiz_workshop/abstracts/choi_2024_vizwiz_CVPR.pdf