CVPR 2024多模态算法推理任务SMART-101挑战赛解决方案
计算机视觉与模式识别
2024-06-11 v1 人工智能
摘要
本文介绍了HYU MLLAB KT团队针对多模态算法推理任务:SMART-101 CVPR 2024挑战赛的解决方案。超越传统的视觉问答问题,SMART-101挑战赛旨在通过解决为6-8岁儿童设计的复杂视觉语言谜题,实现人类级别的多模态理解。为了解决这个问题,我们提出了两个主要思路。首先,为了利用大规模语言模型(LLM)的推理能力,将给定的视觉线索(图像)锚定到文本模态中。为此,我们生成了描述图像上下文的高度详细的文本描述,并将这些描述作为LLM的输入。其次,鉴于谜题图像通常包含各种几何视觉模式的性质,我们利用目标检测算法来确保这些模式在描述生成过程中不被忽略。我们采用了能够检测各种尺寸物体的SAM算法来捕捉这些几何模式的视觉特征,并将此信息作为LLM的输入。在谜题分割配置下,我们在测试集上达到了29.5的选项选择准确率(Oacc),在挑战集上达到了27.1的加权选项选择准确率(WOSA)。
引用
@article{arxiv.2406.05963,
title = {Solution for SMART-101 Challenge of CVPR Multi-modal Algorithmic Reasoning Task 2024},
author = {Jinwoo Ahn and Junhyeok Park and Min-Jun Kim and Kang-Hyeon Kim and So-Yeong Sohn and Yun-Ji Lee and Du-Seong Chang and Yu-Jung Heo and Eun-Sol Kim},
journal= {arXiv preprint arXiv:2406.05963},
year = {2024}
}