ICCV 多模态算法推理任务 2023 SMART-101 挑战赛方案
计算机视觉与模式识别
2023-10-11 v1
摘要
本文给出我们针对多模态算法推理任务 SMART-101 挑战赛的方案。与传统视觉问答数据集不同,该挑战赛评估神经网络在解决专为 6-8 岁儿童的视觉语言谜题时的抽象、演绎与泛化能力。我们采用分而治之的方法。在数据层面,受挑战赛论文启发,我们将全部问题分为八类,并利用 llama-2-chat 模型以零样本方式直接为每题生成类型。此外,我们在 icon45 数据集上训练了 yolov7 模型用于目标检测,并将其与 OCR 方法结合以识别并定位图像中的物体与文本。在模型层面,我们利用 BLIP-2 模型并在图像编码器 VIT-G 上添加八个适配器,以针对不同问题类型自适应提取视觉特征。我们将预构建的问题模板作为输入,并使用 flan-t5-xxl 解码器生成答案。在 puzzle splits 配置下,我们在验证集上取得 26.5 的准确率分数,在私有测试集上取得 24.30。
引用
@article{arxiv.2310.06440,
title = {Solution for SMART-101 Challenge of ICCV Multi-modal Algorithmic Reasoning Task 2023},
author = {Xiangyu Wu and Yang Yang and Shengdong Xu and Yifeng Wu and Qingguo Chen and Jianfeng Lu},
journal= {arXiv preprint arXiv:2310.06440},
year = {2023}
}