理由混合:用于视觉问答的多模态推理混合
计算机视觉与模式识别
2024-06-04 v1 人工智能
机器学习
摘要
零样本视觉问答(VQA)是一项具有挑战性的任务,需要跨模态推理。虽然一些现有方法依赖于思维链(CoT)框架内的单一理由,但它们可能无法捕捉VQA问题的复杂性。另一方面,其他一些使用多种理由的方法可能仍然存在多样性低、模态对齐差以及检索和融合效率低下的问题。针对这些挑战,我们提出了理由混合(MoR),一种新颖的多模态推理方法,用于VQA中混合多种理由。MoR使用单个冻结的视觉语言预训练模型(VLPM)来动态生成、检索和融合多模态思维。我们在两个具有挑战性的VQA数据集(即NLVR2和OKVQA)上评估了MoR,使用了两个代表性骨干网络OFA和VL-T5。MoR在NLVR2上实现了12.43%的准确率提升,在OKVQA-S(OKVQA的科学与技术类别)上实现了2.45%的准确率提升。
引用
@article{arxiv.2406.01402,
title = {Mixture of Rationale: Multi-Modal Reasoning Mixture for Visual Question Answering},
author = {Tao Li and Linjun Shou and Xuejun Liu},
journal= {arXiv preprint arXiv:2406.01402},
year = {2024}
}