中文

FM2DS:面向问答的少样本多模态多跳数据合成与知识蒸馏

计算与语言 2025-09-16 v5 人工智能 计算机视觉与模式识别 信息检索 机器学习

摘要

多模态多跳问答(MMQA)需要对来自多个源的图像和文本进行推理。尽管视觉问答取得了进展,但这种多跳设置由于缺乏高质量数据集而仍未被充分探索。现有方法聚焦于单跳、单模态或短文本,限制了诸如解读具有长多模态内容的教育文档等现实应用。为填补这一空白,我们引入了FM2DS,这是首个为MMQA创建高质量数据集的框架。我们的方法包含一个五阶段流水线,涉及从维基百科获取相关的多模态文档、合成生成高层问题和答案,并通过严格标准进行验证以确保数据质量。我们通过在我们合成的数据集上训练模型并在两个基准——MultimodalQA和WebQA——上进行测试来评估我们的方法。结果表明,在等量样本条件下,在我们合成数据上训练的模型在精确匹配(EM)分数上平均比在人工收集数据上训练的模型高出1.9。此外,我们引入了M2QA-Bench,包含1k个样本,这是首个针对长文档的MMQA基准,由FM2DS生成并经人工标注者精炼。我们相信我们的数据合成方法将为训练和评估MMQA模型奠定坚实基础。

关键词

引用

@article{arxiv.2412.07030,
  title  = {FM2DS: Few-Shot Multimodal Multihop Data Synthesis with Knowledge Distillation for Question Answering},
  author = {Amirhossein Abaskohi and Spandana Gella and Giuseppe Carenini and Issam H. Laradji},
  journal= {arXiv preprint arXiv:2412.07030},
  year   = {2025}
}

备注

Findings of EMNLP 2025