集成文本与图像预训练用于多模态算法推理
计算机视觉与模式识别
2024-06-11 v1 人工智能
摘要
本文提出了我们对CVPR 2024多模态算法推理任务SMART-101挑战的解决方案。与传统的视觉问答任务不同,此挑战评估神经网络在解决为特定儿童(年龄6-8岁)设计的视觉语言拼图方面的抽象化、演绎和泛化能力。我们的模型基于两个预训练模型,分别用于从文本和图像中提取特征。为集成来自不同模态的特征,我们采用了带注意力机制的融合层。我们探索了不同的文本和图像预训练模型,并在SMART-101数据集上对集成分类器进行微调。实验结果表明,在拼图分割数据划分方式下,我们提出的集成分类器取得了卓越的性能,验证了多模态预训练表示的有效性。
引用
@article{arxiv.2406.05318,
title = {Integrating Text and Image Pre-training for Multi-modal Algorithmic Reasoning},
author = {Zijian Zhang and Wei Liu},
journal= {arXiv preprint arXiv:2406.05318},
year = {2024}
}