中文

VLMT:面向多模态多跳问答的视觉-语言多模态 Transformer

计算机视觉与模式识别 2025-04-14 v1 计算与语言

摘要

跨文本、表格和图像的多模态数据的日益增长为开发能够进行复杂跨模态推理的模型带来了新挑战。现有的多模态多跳问答(MMQA)方法往往受限于推理能力、依赖于模态转换以及视觉与文本表示之间的对齐不足。为此,本文提出了视觉-语言多模态 Transformer(VLMT),一种统一架构,将基于 Transformer 的视觉编码器与序列到序列语言模型集成。VLMT 采用直接的 token 级注入机制将视觉和文本输入融合到共享的嵌入空间中,无需中间投影层。为增强跨模态对齐和推理,本文提出了三阶段预训练策略,以逐步对齐视觉-语言表示并提高模型的多模态理解能力。基于预训练的 backbone,本文实例化了两个任务特定的模块,构成两个阶段的 MMQA 框架:一个多模态重排序器预测文档相关性得分,并利用相对阈值和 top-k 策略进行上下文检索;一个多模态问答模型基于检索到的证据生成由上下文所支配的答案。在两个基准数据集上的全面实验表明,所提出的方法有效。在 MultimodalQA 验证集上,VLMT-Large 实现了 76.5% 的精确匹配(Exact Match)和 80.1% 的 F1 分数,超越了前一最先进方法分别提升了 9.1% 和 8.8%。在 WebQA 上,达到了 47.6 的 QA 评分,超越了 PERQA 等先前模型 3.2 分。这些结果突显了 VLMT 在多模态推理方面的强大能力,并展示了其在实际信息检索和问答系统中的潜在前景。

关键词

引用

@article{arxiv.2504.08269,
  title  = {VLMT: Vision-Language Multimodal Transformer for Multimodal Multi-hop Question Answering},
  author = {Qi Zhi Lim and Chin Poo Lee and Kian Ming Lim and Kalaiarasi Sonai Muthu Anbananthen},
  journal= {arXiv preprint arXiv:2504.08269},
  year   = {2025}
}